RLHF-Blender:一个用于从多样化人类反馈中学习的可配置交互界面
机器学习
2023-08-09 v1 人机交互
摘要
为了在实用应用中使用基于人类反馈的强化学习(RLHF),从多样化来源的人类反馈中学习奖励模型并考虑提供不同类型反馈所涉及的人类因素至关重要。然而,对从多样化类型反馈中学习的系统性研究受限于研究者可使用的标准化工具不足。为弥补这一差距,我们提出 RLHF-Blender,一个用于从人类反馈中学习的可配置交互界面。RLHF-Blender 提供了一个模块化的实验框架与实现,使研究者能够系统性地探究人类反馈用于奖励学习的属性与质量。该系统促进了对多种反馈类型的探索,包括示范、排序、比较和自然语言指令,以及考量人类因素对其有效性影响的研究。我们讨论了一组由 RLHF-Blender 所赋能的具体研究机遇。更多信息见 https://rlhfblender.info/。
引用
@article{arxiv.2308.04332,
title = {RLHF-Blender: A Configurable Interactive Interface for Learning from Diverse Human Feedback},
author = {Yannick Metz and David Lindner and Raphaël Baur and Daniel Keim and Mennatallah El-Assady},
journal= {arXiv preprint arXiv:2308.04332},
year = {2023}
}
备注
14 pages, 3 figures