首页 > 最新动态 > TF锐评 | 海量论文看花眼?这5篇具身智能论文值得细读
最新动态
TF锐评 | 海量论文看花眼?这5篇具身智能论文值得细读
2026-07-2025

前言

《TF锐评》是TF技术前线推出的双周栏目。每期由一支SIG的技术专家团队,从海量学术论文、技术博文、实战案例等各类前沿内容中优中选优,提炼核心观点、标注落地价值,帮行业从业者省去筛选成本、直击技术重点,高效吸收前沿成果与实践经验。

本期由 CCF TF 具身智能 SIG 推荐,推荐人:张益民、王志刚、李淼。


#01

Symskill:面向数据高效且具响应性的长时程操作任务的符号与技能协同构建

本文在机器人领域获得了极高的学术认可,连续斩获 ICRA 2026 最佳会议论文奖、ICRA 2026 规划与控制最佳论文奖,以及 CoRL 2025 LEAP workshop的最佳论文奖。其学术价值和影响力得到了业内顶尖专家的一致肯定。本文提出的符号与技能“协同进化”的新范式,有效解决了模仿学习难以泛化与传统规划延迟高的痛点,仅需5分钟真实“玩耍”数据,便能让机器人学会执行12步长程任务并实现实时纠错。在Scaling Law盛行的当下,该研究证明了“符号抽象+技能学习”在数据效率与逻辑推理上的巨大潜力,是具身智能领域不可错过的“逆行”佳作。

点击阅读原文 或 复制链接至浏览器打开:

https://arxiv.org/abs/2510.01661



#02

MEM: Multi-Scale Embodied Memory for Vision Language Action Models

该工作由 Physical Intelligence 等机构团队提出,面向视觉语言动作(VLA)机器人模型。针对现有 VLA 只能处理短时观测、长时序任务易算力爆炸且丢失任务逻辑的缺陷,设计多尺度双分支记忆架构。短期记忆存储近几秒稠密视觉帧,保留空间操作细节,解决遮挡、抓取纠错等精细控制问题。长期记忆用 LLM 生成文本摘要记录全局任务进度,轻量化承载数十分钟长流程语义信息。双记忆特征融合输入 VLA 主干,分别支撑低层精细动作与高层子目标规划。在厨房料理、全屋清洁等超长机械臂任务中,效果优于仅视频或仅文本记忆的基线方案。该工作为长时序具身智能提供了一种分层记忆通用思路,应该是该方向的一个值得关注的工作。

点击阅读原文 或 复制链接至浏览器打开:

项目主页:

https://pi.website/research/memory

论文地址:

https://arxiv.org/abs/2603.03596



#03

SAM 3D: 3Dfy Anything in Images

这个工作获得了CVPR 2026 最佳论文提名,把 SAM 的万物分割能力升维至三维,单目 RGB 即可输出带纹理、位姿的物体 Mesh,对于补齐机器人单目感知缺完整几何的短板是一个较大的进步。依托人机协同数据飞轮解决 3D 数据集稀缺痛点,遮挡、杂乱桌面场景重建效果大大超过传统单图重建,对灵巧手抓取感知增益显著。作为模块化感知底座无缝对接世界模型与抓取规划,省去昂贵深度相机、多目 SLAM,大幅降低家用机器人仿真资产采集成本。当然在生成精细微小物体几何精度仍有不足,也没有内置物理约束,易出现物体悬浮、穿插等违背物理常识的重建结果。整体上看来该工作应该是具身 3D 感知方面值得试用的开源工具,值得大家关注并试用。

点击阅读原文 或 复制链接至浏览器打开:

开源代码:

https://github.com/facebookresearch/sam-3d-objects

论文地址:

https://arxiv.org/abs/2511.16624



#04

AgentSafe: A Safety Benchmark for Vision-Language Embodied Agents

这是今年CVPR的一篇论文,AGENTSAFE 是首个系统评测「具身 VLM 智能体执行危险指令」安全性的 benchmark:它用一个可对接任意 agent 的对抗仿真沙盒(SAFE-THOR)+ 9,900 条按「机器人三定律」分类的危险指令(SAFE-VERSE)+ 跨「感知-规划-执行」三阶段的细粒度诊断协议(SAFE-DIAGNOSE),评测了 9 个 VLM 与 2 套 agent workflow,揭示出当前智能体「能看出危险却无法把这种认知落到规划和执行上」的系统性失效,并给出一个思维层防御模块 SAFE-AUDIT。该工作是机器人安全方面的一个基础性的工作,对具身智能体安全对齐有很好的借鉴意义。随着具身智能机器人应用落地,这方面的工作将会越来越重要。

点击阅读原文 或 复制链接至浏览器打开:

https://arxiv.org/abs/2506.14697



#05

RoboTTT: Context Scaling for Robot Policies

标志着机器人策略学习领域的一次范式突破。长期以来,机器人基础模型受限于单步或短历史上下文,难以处理复杂的长时程任务。RoBoTTT首次将视觉运动上下文窗口扩展至8000个时间步,在保持推理延迟不变的前提下,实现了从视频演示中单次模仿学习、在线策略自我改进、以及抗干扰鲁棒性等全新能力。在长达五分钟、十阶段的装配任务中,RoBoTTT取得了87%的性能提升,而所有基线方法均完全失败。

该工作的核心贡献在于将测试时训练机制融入机器人扩散变压器架构,通过快速权重动态压缩历史信息,并以截断时间反向传播实现高效的长序列训练。更重要的是,论文首次揭示了上下文长度作为机器人基础模型新的扩展维度——预训练上下文从1K扩展至8K时,任务完成率提升62%,且未见饱和趋势,这一发现与大型语言模型的扩展规律形成了呼应,为机器人学习开辟了新的研究前沿。

点击阅读原文 或 复制链接至浏览器打开:

https://research.nvidia.com/labs/gear/robottt/




总策划:

宋继强  CCF TF主席,英特尔中国研究院院长

本期责任主席:

张益民  CCF TF具身智能SIG主席、CCF理事、上海闵行区先进封装与集成系统研究院(上交大先进集成研究院)首席科学家

本期点评人:

张益民  CCF TF具身智能SIG主席、CCF理事、上海闵行区先进封装与集成系统研究院(上交大先进集成研究院)首席科学家

王志刚  CCF TF具身智能SIG副主席、英特尔中国研究院首席工程师

李淼  CCF TF具身智能SIG执委、武汉大学机器人学院副院长、国际IEEE协作自动化与柔性制造技术委员会联席主席




栏目说明

每双周发布,下一期由 CCF TF AI+金融 SIG 推荐。

本文推荐的外部内容著作权归原作者原平台所有。TF仅提供推荐语和原文链接,如有版权疑虑,请联系 tf@ccf.org.cn。

? 如果觉得有用,请点击“推荐”分享给身边的工程师同事。

? 留言区说说:你最近看到的一篇好文?




图片


图片


点击“阅读原文”,加入CCF。

点我访问原文链接