中文

MLaKE: 面向大型语言模型的多语言知识编辑基准

计算与语言 2025-02-20 v3

摘要

大型语言模型(LLMs)的广泛使用凸显了其内部参数中嵌入精确且最新知识的至关重要性。现有的知识编辑研究主要集中在单语言场景,忽略了多语言环境和多跳推理带来的复杂性。为应对这些挑战,我们的研究引入了MLaKE(多语言知识编辑基准),这是一个新颖的基准,包含4072个多跳问题和5360个单跳问题,旨在评估知识编辑方法在五种语言(英语、中文、日语、法语和德语)中的适应性。MLaKE从维基百科跨语言聚合事实链,并利用LLMs生成自由形式和多项选择问题。我们在MLaKE上评估了现有方法的多语言知识编辑泛化能力。现有的知识编辑方法在英语样本中的成功率高于其他语言。然而,它们的泛化能力在多语言实验中有限。值得注意的是,现有的知识编辑方法通常对同一语系内的语言表现出相对较高的泛化能力,而对不同语系的语言则较差。这些结果强调了多语言知识编辑进步的迫切需求,我们希望MLaKE能成为基准测试和解决方案开发的宝贵资源。

关键词

引用

@article{arxiv.2404.04990,
  title  = {MLaKE: Multilingual Knowledge Editing Benchmark for Large Language Models},
  author = {Zihao Wei and Jingcheng Deng and Liang Pang and Hanxing Ding and Huawei Shen and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2404.04990},
  year   = {2025}
}

备注

Accepted as a full paper at COLING 2025