大型语言模型中类人的社会顺从性:通过信号竞争动力学统一阿谀与从众
计算机与社会
2026-01-21 v1
摘要
大语言模型(LLM)日益融入决策框架,暴露出其对社会顺从性的显著脆弱性,具体表现为阿谀与从众。然而,关于使外部社会线索能够系统性覆盖模型内部参数知识的基本机制,目前仍存在关键的研究空白。本研究引入了信号竞争机制,这是一个通过评估 15 个 LLM 的行为相关性并对三个代表性的开源模型进行潜空间探测而验证的统一框架。分析表明,阿谀与从众源于一个收敛的几何流形(下称顺从子空间),其特征在于内部表示具有高度的方向相似性。此外,向顺从状态的转变被证明是一个由线性边界控制的确定性过程,其中社会情绪信号有效抑制了信息校准信号。至关重要的是,我们识别出一种“透明度-真实性差距”,揭示了尽管内部置信度提供了惯性屏障,但它仍然是可渗透的,不足以保证免受强烈社会压力的影响。通过形式化整合认识论对齐框架,本研究为从指令遵从向稳健的认识论完整性过渡提供了蓝图。
引用
@article{arxiv.2601.11563,
title = {Human-like Social Compliance in Large Language Models: Unifying Sycophancy and Conformity through Signal Competition Dynamics},
author = {Long Zhang and Wei-neng Chen},
journal= {arXiv preprint arXiv:2601.11563},
year = {2026}
}