中文

离线偏好学习中的奖励混淆问题探索与解决

机器学习 2024-10-16 v2 人工智能

摘要

奖励模型训练数据中的伪相关性会阻止强化学习从人类反馈(RLHF)识别 desired的目标并诱导不希望的行为。本文表明,离线RLHF在存在离线数据中的伪相关性时尤其容易受到奖励混淆的影响。我们创建一个基准来研究这个问题,并提出一种方法可以通过利用偏好关系的传递性 while构建全局偏好链与主动学习来显著减少奖励混淆。

关键词

引用

@article{arxiv.2407.16025,
  title  = {Exploring and Addressing Reward Confusion in Offline Preference Learning},
  author = {Xin Chen and Sam Toyer and Florian Shkurti},
  journal= {arXiv preprint arXiv:2407.16025},
  year   = {2024}
}

备注

NeurIPS2024 Workshop on Bayesian Decision-making and Uncertainty