中文

异构机器人数据集的跨本体离线强化学习

人工智能 2026-02-23 v1 机器人学

摘要

机器人策略预训练受限于为每个平台收集高质量演示的高成本。为此,本文通过将离线强化学习 (offline RL) 与跨本体学习相结合来缓解此问题。离线 RL 利用专家数据与大量次优数据,而跨本体学习聚合跨不同形态的异构机器人轨迹,以获取通用控制先验。我们对这种离线 RL 与跨本体学习范式进行系统性分析,提供了其优势与局限性的原则性理解。为评估此范式,我们构建了一个涵盖 16 个不同机器人平台的 locomotion 数据集集合。实验表明,这种组合方法在数据集丰富于次优轨迹时表现优异,优于纯行为克隆。然而,随着次优数据比例和机器人类型数量的增加,我们观察到跨形态之间的冲突梯度开始阻碍学习。为缓解此问题,我们引入一种基于本体的分组策略,即将机器人按形态相似性进行聚类,并以组梯度方式更新模型。这种简单且静态的分组显著减少了机器人之间的冲突,并优于现有的冲突解决方法。

关键词

引用

@article{arxiv.2602.18025,
  title  = {Cross-Embodiment Offline Reinforcement Learning for Heterogeneous Robot Datasets},
  author = {Haruki Abe and Takayuki Osa and Yusuke Mukuta and Tatsuya Harada},
  journal= {arXiv preprint arXiv:2602.18025},
  year   = {2026}
}

备注

ICLR 2026