人类反馈的强化学习空间图景:概念框架
机器学习
2025-02-21 v2 人机交互
摘要
基于人类反馈的强化学习(RLHF)已成为微调或训练智能体机器学习模型的强大工具。类似地,人类在社交情境中相互互动,我们可以使用多种类型的反馈来传达我们的偏好、意图和知识给RL代理。然而,人类反馈在RL中的应用往往受限于范围,忽视了人类因素。在本工作中,我们通过发展对人类反馈在交互学习情境中的共享理解来弥合机器学习与人机交互努力之间的差距。我们首先引入一种基于九个关键维度的反馈类型的分类法,用于基于奖励的从人类反馈中学习。我们的分类法允许统一人类中心、界面中心和模型中心方面。在此基础上,我们识别出七个影响人类表达反馈能力和代理学习反馈能力的质量指标。基于反馈分类法和质量标准,我们推导了从反馈中学习系统的要求和设计选择。我们将这些要求和设计选择与交互式机器学习中的现有工作相关联。在此过程中,我们识别了现有工作中的差距和未来研究机会。我们呼吁跨学科合作,以充分发挥数据驱动的共适应建模和多样化交互机制的潜力。
关键词
引用
@article{arxiv.2411.11761,
title = {Mapping out the Space of Human Feedback for Reinforcement Learning: A Conceptual Framework},
author = {Yannick Metz and David Lindner and Raphaël Baur and Mennatallah El-Assady},
journal= {arXiv preprint arXiv:2411.11761},
year = {2025}
}