CueLearner:基于相对反馈的引导式学习和局部策略自适应
机器人学
2025-07-08 v1 机器学习
摘要
人类引导已成为增强强化学习(RL)的有力工具。然而,传统的引导形式,如示范或二元标量反馈,可能难以收集或信息含量低,这促使人们探索其他形式的人类输入。其中,相对反馈(即关于如何改进动作的反馈,例如“再向左一点”)在可用性和信息丰富度之间提供了良好的平衡。先前的研究表明,相对反馈可用于增强策略搜索方法。然而,这些工作仅限于特定的策略类别,并且反馈利用效率低下。在这项工作中,我们引入了一种从相对反馈中学习的新方法,并将其与离策略强化学习相结合。通过在两个稀疏奖励任务上的评估,我们证明了我们的方法可以通过引导强化学习的探索过程来提高其样本效率。此外,我们展示了它可以自适应策略以适应环境或用户偏好的变化。最后,我们通过采用我们的方法在稀疏奖励设置中学习导航策略,证明了其在现实世界中的适用性。
引用
@article{arxiv.2507.04730,
title = {CueLearner: Bootstrapping and local policy adaptation from relative feedback},
author = {Giulio Schiavi and Andrei Cramariuc and Lionel Ott and Roland Siegwart},
journal= {arXiv preprint arXiv:2507.04730},
year = {2025}
}
备注
Accepted to IROS 2025