稀疏神经元承载问题歧义信号:面向大语言模型的分析
计算与语言
2025-09-18 v1 人工智能
摘要
歧义在现实问题中广泛存在,但大型语言模型 (LLM) 常以自信答案回应而非寻求澄清。本文表明,问题歧义在 LLM 内部表征中被线性编码,能够在神经元层面被检测与控制。我们在模型填充阶段识别到,仅少数神经元(最少可为一个)即编码问题歧义信息。基于这些歧义编码神经元 (AEN) 的探针在歧义检测任务上实现强性能,并跨数据集实现良好泛化,优于基于提示的及基于表征的基线方法。层级分析揭示,AEN 从浅层开始出现,表明歧义信号在模型加工流程中即时编码。最后,我们表明通过操控 AEN,可控制 LLM 的行为,从直接作答转向回避。我们的发现表明,LLM 在内部形成问题歧义的紧凑表征,实现可解释且可控的行为。
引用
@article{arxiv.2509.13664,
title = {Sparse Neurons Carry Strong Signals of Question Ambiguity in LLMs},
author = {Zhuoxuan Zhang and Jinhao Duan and Edward Kim and Kaidi Xu},
journal= {arXiv preprint arXiv:2509.13664},
year = {2025}
}
备注
To be appeared in EMNLP 2025 (main)