中文

基于偏好学习的从实时人类反馈中持续策略学习框架:Pref-GUIDE

机器学习 2025-10-08 v2 人工智能

摘要

训练依赖人类反馈的强化学习智能体对于难以通过稠密奖励函数明确任务目标的情况至关重要。虽然先前方法依赖离线轨迹比较来引导人类偏好,但此类数据在代理需实时适应的在线学习场景中不可得。最近的研究方法通过收集实时标量反馈来指导智能体行为,并为在人类反馈停止后训练奖励模型以实现持续学习。然而,标量反馈往往噪声大且不一致,限制了学习奖励模型的准确性和泛化能力。我们提出Pref-GUIDE框架,将实时标量反馈转化为基于偏好的数据,以改进奖励模型学习以支持持续策略训练。Pref-GUIDE Individual通过比较短时间窗口内的智能体行为并过滤模糊反馈来缓解时序不一致性。Pref-GUIDE Voting通过聚合来自用户群体的奖励模型以形成共识偏好来进一步增强鲁棒性。在三个具有挑战性的环境中,Pref-GUIDE显著优于基于标量反馈的基线方法,其中投票变体甚至超越了专家设计的稠密奖励。通过将标量反馈重新框架定为具有群体反馈的结构化偏好,Pref-GUIDE为在线强化学习中利用人类输入提供了可扩展且原则化的方法。

关键词

引用

@article{arxiv.2508.07126,
  title  = {Pref-GUIDE: Continual Policy Learning from Real-Time Human Feedback via Preference-Based Learning},
  author = {Zhengran Ji and Boyuan Chen},
  journal= {arXiv preprint arXiv:2508.07126},
  year   = {2025}
}