中文

PrefCLM: 通过众包大语言模型增强偏好型强化学习

机器人学 2025-01-09 v2

摘要

偏好型强化学习(PbRL)正变为一种通过人类比较反馈来教导机器人的有前景的方法,绕开了复杂奖励工程的需求。然而,现有 PbRL 方法所需的大量反馈常导致依赖于由脚本化教师生成的合成反馈。这一方法再次需要复杂的奖励工程,并且难以适应人机交互(HRI)场景中用户对相同任务可能具有独特期望的细微偏好。为此,本文引入 PrefCLM,一种新框架,该框架将众包大语言模型(LLM)作为 PbRL 中的模拟教师。我们利用德马克特-绍夫理论在评分层面融合多个 LLM 代理的个人偏好,高效地利用它们的多样性和集体智慧。我们还引入了人机交互管线,以便基于用户交互式反馈进行集体改进。实验结果表明,PrefCLM 在 various general RL 任务上实现了与传统脚本化教师相当的性能,并在促进更自然和更高效的行为方面表现出色。进一步的真实世界用户研究(N=10)进一步证明了其针对 individual user preferences 定制机器人行为的能力,显著提升了 HRI 场景中的用户满意度。

关键词

引用

@article{arxiv.2407.08213,
  title  = {PrefCLM: Enhancing Preference-based Reinforcement Learning with Crowdsourced Large Language Models},
  author = {Ruiqi Wang and Dezhong Zhao and Ziqin Yuan and Ike Obi and Byung-Cheol Min},
  journal= {arXiv preprint arXiv:2407.08213},
  year   = {2025}
}