EnQuery:机器人导航偏好对齐中用于多样化查询生成的集成策略
机器人学
2024-06-12 v2
摘要
为了通过基于人类反馈的强化学习(RLHF)将移动机器人导航策略与用户偏好对齐,需要可靠且行为多样化的用户查询。然而,确定性策略无法为给定的导航任务生成多样化的导航轨迹建议。在本文中,我们提出了EnQuery,一种使用集成策略的查询生成方法,通过正则化项实现行为多样性。对于给定的导航任务,EnQuery生成多个导航轨迹建议,从而以更少的查询优化偏好数据收集的效率。我们的方法在低查询场景下在将导航策略与用户偏好对齐方面表现出优越性能,通过稀疏偏好查询实现了更好的策略收敛。评估还辅以新颖的可解释性表示,在单个图中捕捉移动机器人的全场景导航行为。我们的代码可在https://github.com/hrl-bonn/EnQuery获取。
引用
@article{arxiv.2404.04852,
title = {EnQuery: Ensemble Policies for Diverse Query-Generation in Preference Alignment of Robot Navigation},
author = {Jorge de Heuvel and Florian Seiler and Maren Bennewitz},
journal= {arXiv preprint arXiv:2404.04852},
year = {2024}
}