当帮助变得奉承:大型语言模型中社会对齐与认知完整性之间的边界失效
人工智能
2026-05-08 v1
摘要
本立场论文认为,大型语言模型(LLM)中的奉承是社会对齐与认知完整性之间边界失效的表现。现有工作通常通过外部行为 operationalize 奉承,例如与用户错误信念保持一致、观点逆转或偏离客观正确性标准。这些表述仅捕捉现象的显性形式,留下涉及认知完整性和社会对齐的亚细节边界失效未加明确界定。我们认为,奉承不应仅被理解为认同,而应理解为一种将独立认知判断置于特定信念、偏好或自我概念后的对齐行为。为阐明这一边界,我们提出了奉承的三条件框架。首先,用户表达一种信念、偏好或自我概念的线索。其次,模型通过对齐行为转向该线索。第三,此转向损害认知准确性、独立推理或适当纠正。我们还引入了用于分类奉承的分类法,包括对齐目标、机制和严重程度。本文以讨论对齐评估影响、结构化评分标准和缓解策略为结尾,同时将这些提议置于替代观点之上。
引用
@article{arxiv.2605.05403,
title = {When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models},
author = {Jiechen Li and Catherine A. Barry and Rishika Randev and Janet Chen and Ella Jorgensen and Brinnae Bent},
journal= {arXiv preprint arXiv:2605.05403},
year = {2026}
}
备注
Currently under review