中文

触觉从视觉边界开始:面向接触丰富操作的通用策略

机器人学 2025-06-17 v1 计算机视觉与模式识别

摘要

数据驱动方法在精细操作方面困难,仿射学习需要大量难以获取的演示,而强化学习则产生脆弱且不具通用性的策略。我们提出VisuoTactile Local(ViTaL)策略学习框架,通过分解为两个阶段来解决精细操作任务:到达阶段使用视觉-语言模型(VLM)进行场景级推理以定位目标对象;局部交互阶段使用可复用的、与场景无关的ViTaL策略通过自我视觉和触觉感知执行接触丰富的操控。该方法源于这样一个观察:虽然场景上下文变化,但底层交互在不同任务实例中保持一致。通过在标准化环境中训练局部策略一次后,即可通过定位-执行策略实现泛化。ViTaL在未见环境中实现约90%的接触丰富任务成功率,对干扰物具有稳健鲁棒性。ViTaL的有效性源于三个关键见解:(1)Foundation模型用于分割可通过行为克隆训练稳健的视觉编码器;(2)这些编码器提升了使用残差强化学习所学策略的通用性;(3)触觉感知在接触丰富任务中显著提升性能。消融实验验证了这些见解,我们展示了ViTaL与高级VLM良好集成,实现稳健、可复用的低层技能。结果及视频已公开:https://vitalprecise.github.io/。

关键词

引用

@article{arxiv.2506.13762,
  title  = {Touch begins where vision ends: Generalizable policies for contact-rich manipulation},
  author = {Zifan Zhao and Siddhant Haldar and Jinda Cui and Lerrel Pinto and Raunaq Bhirangi},
  journal= {arXiv preprint arXiv:2506.13762},
  year   = {2025}
}