Crowd-PrefRL:基于偏好的众包奖励学习
人机交互
2025-03-21 v2 机器学习
社会与信息网络
摘要
基于偏好的强化学习提供了一种使用人类反馈(通过行为对偏好)训练AI智能体的框架,使得在难以指定数值奖励函数时智能体能够学习期望行为。虽然这种范式利用了人类反馈,但通常将反馈视为来自单个用户。然而,不同用户可能期望多种AI行为及交互模式。同时,以鲁棒方式整合来自人群(用户集合)的偏好反馈仍然是一个挑战,而使用多个用户反馈训练RL智能体的问题研究不足。本文提出概念框架Crowd-PrefRL,将基于偏好的RL方法与无监督众包技术相结合,使得能够从众包反馈中训练自主系统行为。初步结果表明Crowd-PrefRL可以从未知专业性和可靠性的众包偏好反馈中学习奖励函数和智能体策略。还表明,在大多数情况下,使用Crowd-PrefRL训练的智能体优于使用多数投票偏好或任何单个用户偏好训练的智能体,尤其是当人群中用户错误率分布较大时。结果进一步表明,该方法可以以无监督方式识别人群中少数观点的存在。
引用
@article{arxiv.2401.10941,
title = {Crowd-PrefRL: Preference-Based Reward Learning from Crowds},
author = {David Chhan and Ellen Novoseller and Vernon J. Lawhern},
journal= {arXiv preprint arXiv:2401.10941},
year = {2025}
}