ForceVLA:利用力感知 MoE 增强 VLA 模型以实现富接触操作
机器人学
2025-09-19 v3 计算机视觉与模式识别
摘要
视觉-语言-动作(VLA)模型通过利用预训练的视觉与语言表征,推进了通用机器人操作。然而,它们在需要涉及力的细粒度控制的富接触任务中表现挣扎,尤其是在视觉遮挡或动态不确定性下。为解决这些局限性,我们提出 ForceVLA,一个将外部力传感作为 VLA 系统中一等模态的新型端到端操作框架。ForceVLA 引入了 FVLMoE,一个力感知的混合专家融合模块,它在动作解码期间将预训练的视觉-语言嵌入与实时 6 轴力反馈动态集成。这实现了跨特定模态专家的上下文感知路由,增强了机器人适应细微接触动态的能力。我们还引入了 \textbf{ForceVLA-Data},一个新数据集,包含跨越五个富接触操作任务的同步视觉、本体感受和力矩信号。ForceVLA 相比强大的基于 pi_0 的基线将平均任务成功率提高了 23.2%,在插头插入等任务中实现了高达 80% 的成功率。我们的方法突出了多模态集成对于灵巧操作的重要性,并为物理智能机器人控制设定了新基准。代码和数据将发布于 https://sites.google.com/view/forcevla2025。
关键词
引用
@article{arxiv.2505.22159,
title = {ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation},
author = {Jiawen Yu and Hairuo Liu and Qiaojun Yu and Jieji Ren and Ce Hao and Haitong Ding and Guangyu Huang and Guofan Huang and Yan Song and Panpan Cai and Cewu Lu and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2505.22159},
year = {2025}
}
备注
NeurIPS 2025