在多语言大语言模型中隔离文化神经元
计算与语言
2025-11-12 v2
摘要
语言与文化深度交织,但目前尚不清楚多语言大语言模型如何以及位于何处对文化进行编码. 我们基于用于识别语言特定神经元的既定方法,构建了一种本地化和隔离文化特定神经元的方法,仔细 disentangle 这些文化神经元与语言特定神经元之间的重叠与相互作用. 为促进实验,我们引入了 MUREL 数据集,涵盖六种不同文化的 8520 万个标记. 我们的本地化和干预实验表明,LLM 在不同神经元群体中编码不同的文化,主要位于上层,且这些文化神经元可基本独立于语言特定神经元或其他文化特定神经元进行调制. 这些发现表明,多语言语言模型中的文化知识与倾向可以被选择性地隔离和编辑,这对公平性、包容性和对齐具有深远意义. 代码与数据可在 https://github.com/namazifard/Culture_Neurons 查阅.
引用
@article{arxiv.2508.02241,
title = {Isolating Culture Neurons in Multilingual Large Language Models},
author = {Danial Namazifard and Lukas Galke Poech},
journal= {arXiv preprint arXiv:2508.02241},
year = {2025}
}
备注
Accepted at IJCNLP-AACL 2025