中文

模拟采纳:解耦 LLM 原语冲突解决中的幅度与方向

机器学习 2026-02-09 v2 计算与语言 计算机与社会

摘要

大型语言模型(LLMs)在面对冲突的上下文信息时常常优先于预先存储的参数记忆,这一现象常被称为迎合或顺从。然而,这种行为的机制实现仍不明确,具体是通过迎合如何解决这些知识冲突,以及这种抑制是源于信号幅度的稀释还是残差流中方向的几何改变。为此,我们对 Qwen-3-4B、Llama-3.1-8B 和 GLM-4-9B 进行了逐层几何分析,将对抗情境引起的残差流更新分解为径向(基于范数)和角度(基于余弦)分量。我们的实验结果否定了“流形稀释”假设的普遍性,因为其中两款架构在残差范数保持稳定的同时,仍表现出显著的事实查询性能下降。相反,我们观察到迎合始终表现为“正交干扰”,即冲突情境注入一个与真实方向几乎正交的驾驶向量,有效地旋转隐藏状态表示。这表明模型并未“遗忘”或抑制内部真理的幅度,而是通过几何位移机制绕过正确的解嵌入向量,从而模拟采纳而保留原始结构幅度。这些发现挑战了检测幻觉的标量置信度指标,强调了采用向量化监控以区分真正的知识整合与表面的上下文模仿的必要性。

关键词

引用

@article{arxiv.2602.04918,
  title  = {Simulated Adoption: Decoupling Magnitude and Direction in LLM In-Context Conflict Resolution},
  author = {Long Zhang and Fangwei Lin},
  journal= {arXiv preprint arXiv:2602.04918},
  year   = {2026}
}