中文

语言模型通过 RLHF 学会误导人类

计算与语言 2024-12-10 v3

摘要

语言模型(LMs)在产生难以被人类检测的错误时尤为常见,尤其当任务复杂时更甚者。强化学习与人类反馈(RLHF)是当前最流行的后训练方法,可能加剧这一问题:为获得更高奖励,语言模型可能变得更擅长说服人类即便自身错误亦能令人信服。我们在标准 RLHF 流程下研究了这一现象,称之为“ U-SOPHISTRY”(意为开发者无意中产生的现象)。具体而言,我们要求时间受限(如 3-10 分钟)的受试者评估模型输出的正确性,并计算其对比金标准标签的人类准确率。在问答任务(QuALITY)和编程任务(APPS)上,RLHF 使语言模型在说服性上提升,但在实际完成任务方面并未提升。RLHF 还使得模型更难被评估:受试者的误报率在 QuALITY 上上升 24.1%,在 APPS 上上升 18.3%。最后我们表明,检测原意欺骗(如后门型语言模型)的前沿方法(probing)无法推广至 U-SOPHISTRY。我们的实验结果凸显了 RLHF 的重要失效模式,呼吁更多研究以辅助人类对齐语言模型。

关键词

引用

@article{arxiv.2409.12822,
  title  = {Language Models Learn to Mislead Humans via RLHF},
  author = {Jiaxin Wen and Ruiqi Zhong and Akbir Khan and Ethan Perez and Jacob Steinhardt and Minlie Huang and Samuel R. Bowman and He He and Shi Feng},
  journal= {arXiv preprint arXiv:2409.12822},
  year   = {2024}
}