面向策略泛化的无动作推理
机器人学
2025-02-12 v2 人工智能
摘要
端到端模仿学习为训练机器人策略提供了一种有前景的方法。然而,泛化到新环境仍然是一个重大挑战。尽管大规模机器人演示数据集已显示出诱导泛化的潜力,但其扩展需要大量资源。相比之下,人类视频数据丰富多样,是一种有吸引力的替代方案。然而,这些人类视频数据集缺乏动作标签,使其在模仿学习中的使用变得复杂。现有方法试图提取有根基的动作表征(例如手部姿态),但由此产生的策略难以弥合人类与机器人动作之间的具身差距。我们提出了一种替代方法:利用来自人类视频的基于语言的推理——这对于指导机器人动作至关重要——来训练可泛化的机器人策略。基于推理驱动策略架构的最新进展,我们引入了通过无动作数据推理(RAD)。RAD 同时从机器人演示数据(带有推理和动作标签)和无动作人类视频数据(仅带有推理标签)中学习。机器人数据教会模型将推理映射到底层动作,而无动作数据则增强了推理能力。此外,我们将发布一个包含 3,377 个人类手部演示的新数据集,该数据集带有推理注释,与 Bridge V2 基准兼容,旨在促进未来推理驱动的机器人学习研究。我们的实验表明,RAD 能够实现跨越具身差距的有效迁移,使机器人能够执行仅在无动作数据中见过的任务。此外,扩大无动作推理数据的规模显著提高了策略性能和对新任务的泛化能力。这些结果突显了从无动作数据集中进行推理驱动学习在推进可泛化机器人控制方面的前景。项目页面:https://rad-generalization.github.io
引用
@article{arxiv.2502.03729,
title = {Action-Free Reasoning for Policy Generalization},
author = {Jaden Clark and Suvir Mirchandani and Dorsa Sadigh and Suneel Belkhale},
journal= {arXiv preprint arXiv:2502.03729},
year = {2025}
}
备注
13 pages, 10 figures