迈向对语言模型中谄媚行为的理解
计算与语言
2025-05-13 v4 人工智能
机器学习
机器学习
摘要
人类反馈常被用于微调 AI 助手。但人类反馈也可能鼓励模型给出迎合用户信念而非真实情况的回答,这种行为被称为谄媚(sycophancy)。我们研究了在微调过程中使用人类反馈的模型中谄媚行为的普遍程度,以及人类偏好判断在此类行为中的潜在作用。我们首先证明五个最先进的 AI 助手在四项不同的自由文本生成任务中持续表现出谄媚。为理解人类偏好是否驱动了这一被广泛观察到的行为,我们分析了现有的人类偏好数据。我们发现当回答与用户观点一致时,它更可能被偏好。此外,人类与偏好模型(PMs)在不可忽略的比例下,偏好写得有说服力的谄媚回答而非正确回答。针对 PMs 优化模型输出有时也会以牺牲真实性来换取谄媚。总体而言,我们的结果表明谄媚是最先进 AI 助手的普遍行为,部分上很可能由偏好谄媚回答的人类偏好判断所驱动。
引用
@article{arxiv.2310.13548,
title = {Towards Understanding Sycophancy in Language Models},
author = {Mrinank Sharma and Meg Tong and Tomasz Korbak and David Duvenaud and Amanda Askell and Samuel R. Bowman and Newton Cheng and Esin Durmus and Zac Hatfield-Dodds and Scott R. Johnston and Shauna Kravec and Timothy Maxwell and Sam McCandlish and Kamal Ndousse and Oliver Rausch and Nicholas Schiefer and Da Yan and Miranda Zhang and Ethan Perez},
journal= {arXiv preprint arXiv:2310.13548},
year = {2025}
}
备注
32 pages, 20 figures