大型语言模型中文化理解的神经层面分析
计算与语言
2026-03-31 v2
摘要
随着大型语言模型(LLM)在全球范围内的广泛部署,确保其公平且全面的文化理解至关重要。然而,LLM 存在文化偏见且对边缘文化意识有限,而其文化理解机制仍未得到充分探索。为填补这一空白,我们进行了神经层面的分析,以识别驱动文化行为的神经元,引入基于梯度的评分方法并添加过滤以实现精确细化。我们识别出与文化无关性格的神经元(culture-general neurons),以及与单个文化相关的神经元(culture-specific neurons)。文化通用神经元和文化特定神经元占所有神经元的不到 1%,并集中在浅层到中层的 MLP 层中。通过抑制这些神经元,在文化基准测试中性能下降最多可达 30%,而在一般自然语言理解(NLU)基准测试中的性能则基本不受影响。此外,我们展示了文化特定神经元不仅支持目标文化的知识,也支持相关文化。最后,我们证明,在更新包含大量文化通用神经元的模块后,使用 NLU 基准进行训练会削弱模型的文化理解能力。这些发现为理解 LLM 内部机制提供了洞见,并为模型训练和工程实践提供了实际指导。我们的代码已公开于 https://github.com/ynklab/CULNIG
引用
@article{arxiv.2510.08284,
title = {Neuron-Level Analysis of Cultural Understanding in Large Language Models},
author = {Taisei Yamamoto and Ryoma Kumon and Danushka Bollegala and Hitomi Yanaka},
journal= {arXiv preprint arXiv:2510.08284},
year = {2026}
}
备注
Accepted to ICLR 2026