基于跨语言不一致性的Mixture-of-Experts LLM 知识局部化
计算与语言
2026-03-19 v1 人工智能
机器学习
摘要
现代大语言模型(LLM)在不同语言间表现出显著的行为差异,例如在某些语言中能够记得事实信息,而在其他语言中则不能。虽然通常将其研究为需要缓解的问题,但本文提出将这种跨语言不一致性作为可解释性工具用于混合专家(MoE)LLM。我们的知识局部化框架通过对比语言集合中正确记得信息的语言和失败记得信息的语言的路由方式来实现这一点。这使我们能够隔离在回答特定知识问题中发挥功能作用的模型组件。该方法分为两个阶段:(1)通过在多样化语言集合中对困难事实问题进行查询,以生成“成功”和“失败”激活桶;(2)对 MoE 路由逻辑进行统计对比分析,以识别对知识重要的专家。为验证此少数专家对回答知识问题的必要性,我们停用这些专家并重新提问。我们发现,尽管仅停用约 20 个专家(总计 6000 个),但在超过 40% 的情况下,模型仍无法正确回答。一般而言,该方法为解决日益复杂的 LLM 提供了一种真实且可扩展的知识局部化方法。
引用
@article{arxiv.2603.17102,
title = {Knowledge Localization in Mixture-of-Experts LLMs Using Cross-Lingual Inconsistency},
author = {Lucas Bandarkar and Alan Ansell and Trevor Cohn},
journal= {arXiv preprint arXiv:2603.17102},
year = {2026}
}