基于群组的交互式比较:强化学习从人类反馈
机器学习
2025-12-01 v2 人机交互
摘要
强化学习从人类反馈(RLHF)已成为对齐AI行为与人类偏好关键技术的核心。传统RLHF数据收集方式依赖两两比较:人类评估者被要求指明两个样本中更喜欢哪一个。我们提出了一种交互式可视化工具,更有效地利用人类视觉能力对大量样本进行比较与探索。该界面由两个联动视图构成:1)探索视图展示所有采样行为的语境概览,按层次聚类结构组织;2)比较视图显示用户查询选取的两个样本组。用户可通过在这两个视图之间循环迭代,高效探索大规模行为集合。此外,我们设计了一种主动学习方法,建议进行样本组比较。在六个模拟机器人任务中的评估表明,我们的方法使最终奖励提升69.34%,错误率降低,策略更优。我们开源代码,可轻松集成至RLHF训练循环,支持人机对齐研究。
引用
@article{arxiv.2507.04340,
title = {Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback},
author = {Jan Kompatscher and Danqing Shi and Giovanna Varni and Tino Weinkauf and Antti Oulasvirta},
journal= {arXiv preprint arXiv:2507.04340},
year = {2025}
}
备注
10 pages, 8 figures in proceedings of Computer Graphics Forum