中文

面向长期对抗性任务的样本高效偏好式逆强化学习:基于次优分层演示

机器学习 2025-07-14 v1 机器人学

摘要

逆强化学习(IRL)是一种从人类演示中学习复杂机器人任务的强大范式。然而,大多数方法都假设可获得专家演示,而这往往并非如此。那些允许演示次优的方法也并未针对长期目标或对抗性任务进行设计。许多理想的机器人能力归属于这两类中的一种或两类,因而凸显了IRL在生产场地就绪机器人智能体方面的关键短板。我们提出Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations (SPLASH),该方法推动了从次优演示学习到长期目标和对抗性设置的技术进步。我们在仿真中的海上抓标志任务中经验性地验证了SPLASH,并通过仿真到现实的迁移实验展示了其在自主无人水面车辆上的实际应用性。我们表明,我们提出的方法使SPLASH在次优演示中从奖励学习方面显著优于现有技术。

关键词

引用

@article{arxiv.2507.08707,
  title  = {SPLASH! Sample-efficient Preference-based inverse reinforcement learning for Long-horizon Adversarial tasks from Suboptimal Hierarchical demonstrations},
  author = {Peter Crowley and Zachary Serlin and Tyler Paine and Makai Mann and Michael Benjamin and Calin Belta},
  journal= {arXiv preprint arXiv:2507.08707},
  year   = {2025}
}