中文

通过 RL 增强遥控操作与混合型灵巧专家 VLA 实现类人操作

机器人学 2026-03-10 v1

摘要

虽然 Vision-Language-Action(VLA)模型在机器人操作中取得了显著成功,但其应用主要局限于低自由度末端执行器进行简单的、以视觉为导向的抓取与放置任务。将这些模型扩展到人类化、双手灵巧操作——具体言之,接触丰富的手部操作——带来了数据获取、多技能学习和多模态感知融合等关键挑战。本文提出一个集成框架以缓解这些瓶颈,基于两个组件。首先,我们引入 IMCopilot(手部操作协同员),一套经过强化学习训练的原子技能,既可作为 shared-autonomy 助手简化遥控操作数据收集,又可作为可调用的低层执行原语供 VLA 使用。其次,我们提出 MoDE-VLA(Mixture-of-Dexterous-Experts VLA),一种无缝整合异构力和触觉模态的 VLA 架构。通过利用残差注入机制,MoDE-VLA 能够在不损害模型预训练知识的前提下实现接触感知的细化。我们在四个复杂度递增的任务上进行验证,表明在灵巧接触丰富任务上,方法相较于基线实现了翻倍的成功率提升。

关键词

引用

@article{arxiv.2603.08122,
  title  = {Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA},
  author = {Tutian Tang and Xingyu Ji and Wanli Xing and Ce Hao and Wenqiang Xu and Lin Shao and Cewu Lu and Qiaojun Yu and Jiangmiao Pang and Kaifeng Zhang},
  journal= {arXiv preprint arXiv:2603.08122},
  year   = {2026}
}

备注

Project Homepage: https://sites.google.com/view/mode-vla