真理神经元
计算与语言
2025-07-09 v3
摘要
尽管语言模型在各类工作流程中取得了显著的成功并得到广泛部署,但有时会产生不诚实的响应。我们对诚实性在这些模型中机制化方式的有限理解危及了其可靠性和安全性。本文提出一种识别语言模型中诚实性表征的方法,侧重于神经元层面。我们展示,语言模型包含诚实神经元,这些神经元以一种不依赖主体的方式对诚实性进行编码。跨不同规模模型的实验验证了诚实神经元的存在,确认了在神经元层面对诚实性编码是众多语言模型所共享的属性。诚实神经元在不同层中的分布模式与先前关于诚实性几何性质的发现相吻合。选择性抑制通过 TruthfulQA 数据集识别到的诚实神经元的激活,会在 TruthfulQA 以及其他基准测试上降低性能,表明诚实性机制并非局限于特定数据集。我们的结果为理解语言模型中诚实性机制提供了新的见解,并为提高其可信度和可靠性指明了潜在方向。
引用
@article{arxiv.2505.12182,
title = {Truth Neurons},
author = {Haohang Li and Yupeng Cao and Yangyang Yu and Jordan W. Suchow and Zining Zhu},
journal= {arXiv preprint arXiv:2505.12182},
year = {2025}
}