中文

PoCo:基于并面向异构机器人学习的策略组合

机器人学 2024-12-03 v3 机器学习

摘要

从异构数据中为不同任务训练通用机器人策略是一项重大挑战。现有的机器人数据集在颜色、深度、触觉和本体感觉信息等不同模态上存在差异,并且是在仿真、真实机器人和人类视频等不同领域收集的。当前方法通常收集并汇集来自单一领域的所有数据以训练单一策略来处理任务和领域中的这种异构性,这既昂贵又困难。在这项工作中,我们提出了一种灵活的方法,称为策略组合,通过组合用扩散模型表示的不同数据分布,来跨如此多样的模态和领域组合信息,以学习场景级和任务级的泛化操作技能。我们的方法可以使用任务级组合进行多任务操作,并可与解析代价函数组合以在推理时调整策略行为。我们在仿真、人类和真实机器人数据上训练了该方法,并在工具使用任务中进行了评估。组合策略在不同场景和任务下实现了稳健且灵巧的性能,并在仿真和真实世界实验中均优于来自单一数据源的基线。更多详情请参见 https://liruiw.github.io/policycomp。

关键词

引用

@article{arxiv.2402.02511,
  title  = {PoCo: Policy Composition from and for Heterogeneous Robot Learning},
  author = {Lirui Wang and Jialiang Zhao and Yilun Du and Edward H. Adelson and Russ Tedrake},
  journal= {arXiv preprint arXiv:2402.02511},
  year   = {2024}
}

备注

R:SS 2024