语言特定神经元不促进跨语言迁移
计算与语言
2025-03-25 v1 人工智能
机器学习
摘要
多语言大型语言模型(LLM)旨在实现跨多语言的稳健自然语言理解,但在低资源语言上的性能显著下降。本工作探讨是否存在已有技术用于识别语言特定神经元,可被用于提高低资源语言的跨语言任务性能。我们进行了详尽实验,涵盖现有的语言特定神经元识别技术(如Language Activation Probability Entropy和基于激活概率的阈值方法),以及针对Llama 3.1和Mistral Nemo的神经元特定LoRA微调。我们发现,此类神经元特定干预对在下游任务(XNLI、XQuAD)上的低资源语言跨语言性能提升不够。本研究凸显了实现跨语言泛化的挑战,并为多语言LLM提供了关键见解。
引用
@article{arxiv.2503.17456,
title = {Language-specific Neurons Do Not Facilitate Cross-Lingual Transfer},
author = {Soumen Kumar Mondal and Sayambhu Sen and Abhishek Singhania and Preethi Jyothi},
journal= {arXiv preprint arXiv:2503.17456},
year = {2025}
}
备注
Accepted (oral) at NAACL 2025 (InsightsNLP)