中文

RLHF 与 IIA:逆向激励

机器学习 2024-02-02 v3 人工智能 计算与语言

摘要

现有的基于人类反馈的强化学习(RLHF)算法可能会激励与偏好相悖的响应,因为它们基于无关替代品独立性(IIA)假设的模型。IIA 诱导的逆向激励阻碍了查询格式与学习算法的创新。

关键词

引用

@article{arxiv.2312.01057,
  title  = {RLHF and IIA: Perverse Incentives},
  author = {Wanqiao Xu and Shi Dong and Xiuyuan Lu and Grace Lam and Zheng Wen and Benjamin Van Roy},
  journal= {arXiv preprint arXiv:2312.01057},
  year   = {2024}
}