RLHF 与 IIA:逆向激励
机器学习
2024-02-02 v3 人工智能
计算与语言
摘要
现有的基于人类反馈的强化学习(RLHF)算法可能会激励与偏好相悖的响应,因为它们基于无关替代品独立性(IIA)假设的模型。IIA 诱导的逆向激励阻碍了查询格式与学习算法的创新。
关键词
引用
@article{arxiv.2312.01057,
title = {RLHF and IIA: Perverse Incentives},
author = {Wanqiao Xu and Shi Dong and Xiuyuan Lu and Grace Lam and Zheng Wen and Benjamin Van Roy},
journal= {arXiv preprint arXiv:2312.01057},
year = {2024}
}