超越视界:通过语言 grounding 对异构传感器进行通用机器人策略微调
机器人学
2025-01-16 v3 人工智能
摘要
与世界交互是一种多感官经验:实现有效的通用交互需要利用所有可用模态,包括视觉、触觉和听觉,以弥补部分观察的差距。例如,在视觉被遮挡时触摸包内的物品,机器人应依赖触觉和听觉。然而,当前的通用机器人策略通常是在大规模数据集上训练,仅基于视觉和 proprioceptive 观察来预测机器人动作。在本工作中,我们提出了一种新方法FuSe,通过自然语言作为跨模态 grounding,使能够在缺乏大规模数据的异构传感器模态上微调视觉-运动通用策略。我们结合多模态对比损失和感官 grounding 语言生成损失来编码高层语义。在机器人操控语境中,我们展示FuSe能够在零样本设置下执行需要在视觉、触觉和听觉等模态之间进行联合推理的具有挑战性的任务,包括多模态提示、组合跨模态提示以及对其交互物体的描述。我们表明,相同的方案同样适用于广泛不同的通用策略,包括基于扩散的通用策略和大型视觉-语言-动作(VLA)模型。大量现实实验表明,FuSe的成功率比所有所考虑的基线提高了超过20%。
关键词
引用
@article{arxiv.2501.04693,
title = {Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding},
author = {Joshua Jones and Oier Mees and Carmelo Sferrazza and Kyle Stachowicz and Pieter Abbeel and Sergey Levine},
journal= {arXiv preprint arXiv:2501.04693},
year = {2025}
}