礼貌的说谎者:语言模型中的认识偏差
计算机与社会
2025-11-12 v1 人工智能
计算与语言
摘要
大型语言模型呈现出一种独特的认识偏差:即便它们并不了解信息,却仍以自身了解之姿态进行表达。本文认为,这种自信的虚构行为——即我所称的礼貌说谎者——是强化学习从人类反馈 (RLHF) 的结构性结果。基于弗兰克斯特对“bullshit”作为对真理的communicative indifference的分析,本文指出,这种偏差并非欺骗,而是结构性的认识冷漠:一种针对感知诚实性而非证据准确性进行优化的奖励架构。当前的对齐方法奖励模型在有帮助、无危害且礼貌方面的表现,但不奖励其在认识基础上的表现。结果是,系统学习了最大化用户满意度,而非真理,从而将对话流畅性视为一种美德。我通过认识美德理论、言语行为哲学和认知对齐等多个视角分析了这种行为,表明 RLHF 产生的代理训练出于模拟认识信心,却不具备认识正当性的能力。礼貌说谎者揭示了语言合作与认识完整性之间更深层的对齐张力。本文以“认识对齐”原则为结论:奖励正当信心,而非感知流畅性。
引用
@article{arxiv.2511.07477,
title = {The Polite Liar: Epistemic Pathology in Language Models},
author = {Bentley DeVilling},
journal= {arXiv preprint arXiv:2511.07477},
year = {2025}
}
备注
17 pages, 2 tables, Preprint - under review at AI & Society