中文

TA-VLA:阐明力矩感知视觉-语言-动作模型的设计空间

机器人学 2025-09-10 v1

摘要

许多机器人操控任务需要感知和响应力信号(如力矩)以评估任务是否成功完成并实现闭环控制。然而,当前的视觉-语言-动作(VLA)模型缺乏整合此类细微物理反馈的能力。在本工作中,我们探索力矩感知 VLA 模型,旨在通过系统研究将力矩信号纳入现有 VLA 架构的设计空间来弥合这一差距。我们识别并评估了若干策略,得出三个关键发现。第一,在解码器中引入力矩适配器始终优于将其插入编码器。第三,受自动驾驶中联合预测与规划范式的启发,我们提出将力矩预测为辅助输出,进一步提升了性能。这一策略鼓励模型建立物理基础的交互动力学内部表示。在接触丰富操控基准上的大量定量和定性实验验证了我们的发现。

关键词

引用

@article{arxiv.2509.07962,
  title  = {TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models},
  author = {Zongzheng Zhang and Haobo Xu and Zhuo Yang and Chenghao Yue and Zehao Lin and Huan-ang Gao and Ziwei Wang and Hao Zhao},
  journal= {arXiv preprint arXiv:2509.07962},
  year   = {2025}
}

备注

Accepted to CoRL 2025, project page: \url{https://zzongzheng0918.github.io/Torque-Aware-VLA.github.io/}