中文

HALO:面向机器人导航的人类偏好对齐离线奖励学习

机器人学 2025-08-05 v1

摘要

本文介绍了HALO,这是一种新颖的离线奖励学习算法,将导航中的人类直觉量化为基于视觉的奖励函数,用于机器人导航。HALO从离线数据中学习奖励模型,利用来自移动机器人的专家轨迹收集的数据。在训练期间,动作在参考动作周围均匀采样,并根据以热力学分布中心的偏好动作派生的偏好分数进行排序,并根据来自直观导航查询的二元用户反馈进行塑形。奖励模型通过Plackett-Luce损失训练,以与这些排名的偏好相匹配。为演示HALO的有效性,我们在两个下游应用中部署其奖励模型:(i) 在HALO派生的奖励上直接训练的离线学习策略,和(ii) 将HALO奖励作为额外代价项纳入基于模型预测控制(MPC)的规划器。这展示了HALO在学习基于和经典导航框架中的灵活性。我们在Clearpath Husky上进行了实际部署,覆盖多种场景,表明使用HALO训练的策略能够有效地泛化到训练数据中未出现的看似环境和硬件设置。HALO在当前基于视觉的导航方法中超过了一个SOTA方法,成功率至少提高了33.3%,归一化轨迹长度减少12.9%,与人类专家轨迹之间的Frechet距离减少26.6%。

关键词

引用

@article{arxiv.2508.01539,
  title  = {HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation},
  author = {Gershom Seneviratne and Jianyu An and Sahire Ellahy and Kasun Weerakoon and Mohamed Bashir Elnoor and Jonathan Deepak Kannan and Amogha Thalihalla Sunil and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2508.01539},
  year   = {2025}
}