中文

使用非专家数据通过离线强化学习来增强模仿学习的鲁棒性

机器人学 2025-10-28 v2 人工智能 机器学习

摘要

模仿学习已被证明有效地用于从专家人类演示中训练机器人执行复杂任务。然而,它仍受限于对高质量、任务特定数据的依赖,这限制了其对现实世界中多样化物体配置和情景的适应性。相比之下,非专家数据——例如玩耍数据、次优演示、部分任务完成或来自次优策略的 rollout——可以提供更广泛的覆盖范围和更低的收集成本。然而,传统的模仿学习方法无法有效利用这些数据。为了应对这些挑战,我们认为,只要做出正确的设计决策,离线强化学习就可以作为一种工具来利用非专家数据来增强模仿学习策略的性能。我们展示,尽管标准的离线 RL 方法在现实世界中常见的稀疏数据覆盖设置下无法有效利用非专家数据,但通过一些简单的算法修改,就可以在不显著额外假设的情况下利用这些数据。我们的做法表明,扩大策略分布的支持可以使增强了离线 RL 的模仿算法能够稳健地解决任务,显示出显著的恢复和泛化行为。在操作任务中,这些创新显著增加了在包含非专家数据时所学习策略成功的初始条件范围。此外,我们表明这些方法能够利用所有收集的数据,包括部分或次优演示,以强化任务导向策略的性能。这凸显了利用非专家数据进行稳健策略学习在机器人领域的重要性。

关键词

引用

@article{arxiv.2510.19495,
  title  = {Using Non-Expert Data to Robustify Imitation Learning via Offline Reinforcement Learning},
  author = {Kevin Huang and Rosario Scalise and Cleah Winston and Ayush Agrawal and Yunchu Zhang and Rohan Baijal and Markus Grotz and Byron Boots and Benjamin Burchfiel and Masha Itkina and Paarth Shah and Abhishek Gupta},
  journal= {arXiv preprint arXiv:2510.19495},
  year   = {2025}
}