中文

超越视界:通过语言 grounding 对异构传感器进行通用机器人策略微调

机器人学 2025-01-16 v3 人工智能

摘要

与世界交互是一种多感官经验:实现有效的通用交互需要利用所有可用模态,包括视觉、触觉和听觉,以弥补部分观察的差距。例如,在视觉被遮挡时触摸包内的物品,机器人应依赖触觉和听觉。然而,当前的通用机器人策略通常是在大规模数据集上训练,仅基于视觉和 proprioceptive 观察来预测机器人动作。在本工作中,我们提出了一种新方法FuSe,通过自然语言作为跨模态 grounding,使能够在缺乏大规模数据的异构传感器模态上微调视觉-运动通用策略。我们结合多模态对比损失和感官 grounding 语言生成损失来编码高层语义。在机器人操控语境中,我们展示FuSe能够在零样本设置下执行需要在视觉、触觉和听觉等模态之间进行联合推理的具有挑战性的任务,包括多模态提示、组合跨模态提示以及对其交互物体的描述。我们表明,相同的方案同样适用于广泛不同的通用策略,包括基于扩散的通用策略和大型视觉-语言-动作(VLA)模型。大量现实实验表明,FuSe的成功率比所有所考虑的基线提高了超过20%。

关键词

引用

@article{arxiv.2501.04693,
  title  = {Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding},
  author = {Joshua Jones and Oier Mees and Carmelo Sferrazza and Kyle Stachowicz and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:2501.04693},
  year   = {2025}
}