中文

稀疏神经元承载问题歧义信号:面向大语言模型的分析

计算与语言 2025-09-18 v1 人工智能

摘要

歧义在现实问题中广泛存在,但大型语言模型 (LLM) 常以自信答案回应而非寻求澄清。本文表明,问题歧义在 LLM 内部表征中被线性编码,能够在神经元层面被检测与控制。我们在模型填充阶段识别到,仅少数神经元(最少可为一个)即编码问题歧义信息。基于这些歧义编码神经元 (AEN) 的探针在歧义检测任务上实现强性能,并跨数据集实现良好泛化,优于基于提示的及基于表征的基线方法。层级分析揭示,AEN 从浅层开始出现,表明歧义信号在模型加工流程中即时编码。最后,我们表明通过操控 AEN,可控制 LLM 的行为,从直接作答转向回避。我们的发现表明,LLM 在内部形成问题歧义的紧凑表征,实现可解释且可控的行为。

关键词

引用

@article{arxiv.2509.13664,
  title  = {Sparse Neurons Carry Strong Signals of Question Ambiguity in LLMs},
  author = {Zhuoxuan Zhang and Jinhao Duan and Edward Kim and Kaidi Xu},
  journal= {arXiv preprint arXiv:2509.13664},
  year   = {2025}
}

备注

To be appeared in EMNLP 2025 (main)