中文

OmniVTA: 基于视觉-触觉的接触丰富机器人操作世界模型

机器人学 2026-03-24 v2

摘要

接触丰富的操控任务(如擦拭和装配)需要准确感知接触力、摩擦变化以及状态转换,这些因素无法仅通过视觉信息可靠地推断。尽管对视觉-触觉操控日益关注,但进展受到两个持久限制:现有数据集规模小且任务覆盖范围有限,以及当前方法将触觉信号视为被动观察,而未利用其建模接触动力学或实现闭环控制。本文提出了 \textbf{OmniViTac},一个规模宏大的视觉-触觉-动作数据集,包含 21,000+21{,}000+ 条轨迹,覆盖 8686 个任务和 100+100+ 个物体,组织为六种基于物理的互动模式。基于该数据集,我们提出 \textbf{OmniVTA},一个基于世界模型的视觉-触觉操控框架,集成四个紧密耦合的模块:自监督触觉编码器、用于预测短时接触演化的双流视觉-触觉世界模型、用于动作生成的接触感知融合策略,以及运行于 60Hz 的自律控制器,通过闭环纠正预测与观测触觉信号之间的偏差。实验在六大类互动范畴内显示,OmniVTA 在未见物体和几何配置上超越现有方法并表现出良好泛化能力,证明了将预测性接触建模与高频触觉反馈相结合对接触丰富的操控具有重要价值。所有数据、模型和代码将在项目网站 https://mrsecant.github.io/OmniVTA 上公开。

关键词

引用

@article{arxiv.2603.19201,
  title  = {OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation},
  author = {Yuhang Zheng and Songen Gu and Weize Li and Yupeng Zheng and Yujie Zang and Shuai Tian and Xiang Li and Ce Hao and Chen Gao and Si Liu and Haoran Li and Yilun Chen and Shuicheng Yan and Wenchao Ding},
  journal= {arXiv preprint arXiv:2603.19201},
  year   = {2026}
}

备注

TARS Robotics Project Page: https://mrsecant.github.io/OmniVTA