基于众包的强化学习中的主动查询选择
机器学习
2025-08-27 v1
摘要
基于偏好的强化学习作为一种在奖励信号难以指定或与人类意图不一致的环境中训练智能体的策略,已日益受到重视。然而,其有效性通常受到可靠人类输入的高成本和低可用性的限制,尤其是在专家反馈稀缺或错误代价高昂的领域。为解决此问题,我们提出了一个结合两种互补策略的新框架:用于处理嘈杂、多标注者反馈的概率众包建模,以及用于优先获取最具信息量智能体动作反馈的主动学习。我们扩展了Advise算法以支持多个训练者,在线估计他们的可靠性,并引入基于熵的查询选择来指导反馈请求。我们在一系列跨越合成和受现实世界启发的环境中评估了我们的方法,包括2D游戏(Taxi、Pacman、Frozen Lake)和使用临床批准的UVA/Padova模拟器进行的1型糖尿病血糖控制任务。我们的初步结果表明,在大多数任务中,基于不确定轨迹反馈训练的智能体表现出更快的学习速度,并且在血糖控制任务中,我们的方法优于基线方法。
引用
@article{arxiv.2508.19132,
title = {Active Query Selection for Crowd-Based Reinforcement Learning},
author = {Jonathan Erskine and Taku Yamagata and Raúl Santos-Rodríguez},
journal= {arXiv preprint arXiv:2508.19132},
year = {2025}
}
备注
7 pages, 4 figures, 2 tables plus appendices