英语中心大型语言模型中语言混淆的机制性理解与缓解
计算与语言
2025-09-19 v2
摘要
语言混淆——即大型语言模型(LLMs)生成的用户需求之外的意外语言——仍是一个关键挑战,尤其是针对以英语为中心的模型。我们进行了首次针对语言混淆的机制性可解释性( MI)研究,结合了行为基准测试和神经元水平分析。通过语言混淆基准(LCB),我们表明混淆点(CP)——语言切换发生的特定位置——是这一现象的核心。通过分层分析结合 TunedLens 和目标神经元归因,我们揭示了最终层的转换失败是导致混淆的原因。我们进一步演示,通过编辑通过与多语言调优模型的比较分析识别的少数关键神经元,可以显著缓解混淆,同时基本保持一般能力和流畅度。我们的做法在许多语言上与多语言对齐相当,产出更干净、更高质量的输出。这些发现为我们提供了对LLMs内部动态的新见解,凸显了神经元水平干预作为稳健、可解释多语言语言建模的有前景方向。代码和数据可在 https://github.com/ercong21/lang_confusion 获取。
引用
@article{arxiv.2505.16538,
title = {Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models},
author = {Ercong Nie and Helmut Schmid and Hinrich Schütze},
journal= {arXiv preprint arXiv:2505.16538},
year = {2025}
}
备注
Accepted to EMNLP 2025 Findings