离线偏好学习中的奖励混淆问题探索与解决
机器学习
2024-10-16 v2 人工智能
摘要
奖励模型训练数据中的伪相关性会阻止强化学习从人类反馈(RLHF)识别 desired的目标并诱导不希望的行为。本文表明,离线RLHF在存在离线数据中的伪相关性时尤其容易受到奖励混淆的影响。我们创建一个基准来研究这个问题,并提出一种方法可以通过利用偏好关系的传递性 while构建全局偏好链与主动学习来显著减少奖励混淆。
引用
@article{arxiv.2407.16025,
title = {Exploring and Addressing Reward Confusion in Offline Preference Learning},
author = {Xin Chen and Sam Toyer and Florian Shkurti},
journal= {arXiv preprint arXiv:2407.16025},
year = {2024}
}
备注
NeurIPS2024 Workshop on Bayesian Decision-making and Uncertainty