大型语言模型判断的统一表征
计算与语言
2025-11-05 v2
摘要
生物智能与人工智能的核心架构问题之一是判断是否依赖特定模块化结构,还是依赖统一的、领域通用的资源。尽管大型语言模型(Large Language Models, LLMs)中对不同概念的可解码神经表征的发现暗示了模块化架构,但这些表征是否真正独立仍是未知问题。本文提供了评估性判断收敛架构的证据。我们发现,无论是何种 LLM,都存在一种主导维度用于计算多样化的评估性判断,我们称之为价值-接受轴(Valence-Assent Axis, VAA)。该轴联合编码主观价值("什么是好的")以及模型对事实性声明的接受程度("什么是真的")。通过直接干预,我们展示了该轴驱动了关键机制——从属推理:VAA 作为控制信号,引导生成过程构建与其评估状态相符的论证,即便以牺牲事实准确性为代价。我们的发现提供了对响应偏差和幻觉的机制性解释,揭示了促进判断连贯性的架构如何系统性地削弱忠实推理。
引用
@article{arxiv.2510.27328,
title = {A Unified Representation Underlying the Judgment of Large Language Models},
author = {Yi-Long Lu and Jiajun Song and Wei Wang},
journal= {arXiv preprint arXiv:2510.27328},
year = {2025}
}