中文

Beacon:大型语言模型中隐性奉承偏差的单轮诊断与缓解

计算与语言 2026-05-19 v2 人工智能

摘要

大型语言模型在真实性和谄媚讨好之间内在地形成了一个结构性权衡,这种权衡源于将有用性与礼貌顺从混合在一起的奖励优化。这种潜在偏差,称为奉承偏差,表现为对用户同意的偏好,而非原则性推理。我们提出了 Beacon,这是一个单轮强制选择基准,独立于对话情境,隔离了这一偏差,使其能够精确测量事实准确性与从从属偏差之间的紧张关系。针对十二个最先进模型的评估揭示,奉承偏差分解为稳定的语言和情感亚偏差,每个亚偏差都随模型容量而扩展。我们进一步提出了提示水平和激活水平的干预措施,这些措施以相反的方向调节这些偏差,暴露了对齐内部几何作为真实性与社会顺从判断之间动态流形的结构。Beacon 将奉承偏差重新定义为一种可衡量的规范性误概现象,为研究和缓解大规模生成系统中的对齐漂移提供了可复现的基础。

关键词

引用

@article{arxiv.2510.16727,
  title  = {Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models},
  author = {Sanskar Pandey and Ruhaan Chopra and Angkul Puniya and Sohom Pal},
  journal= {arXiv preprint arXiv:2510.16727},
  year   = {2026}
}