中文

多语言语言模型中的跨语言编辑

计算与语言 2024-02-06 v2 人工智能

摘要

大型语言模型(LLMs)的训练需要大量数据和计算资源,而更新过时的 LLMs 需要耗费巨大的精力和资源。尽管出现了许多模型编辑技术(METs)以在不重新训练的情况下高效更新模型输出,但其在知识以多种语言存储的多语言 LLMs 中的有效性仍是一个未被充分探索的研究领域。本文引入了跨语言模型编辑(\textbf{XME})范式,其中在一种语言中编辑某个事实,并观察随后在其他语言中的更新传播。为了研究 XME 范式,我们使用 BLOOM、mBERT 和 XLM-RoBERTa 进行了实验,采用了两种书写文字体系:\textit{Latin}(英语、法语和西班牙语)和 \textit{Indic}(印地语、古吉拉特语和孟加拉语)。结果表明,最先进的 METs 在 XME 设置下存在显著的性能局限性,特别是当涉及的语言属于两个不同的文字体系时。这些发现凸显了进一步研究和开发 XME 技术以应对这些挑战的必要性。有关更全面的信息,本研究使用的数据集和相关代码已在以下 URL 公开:\url{https://github.com/lingo-iitgn/XME}。

关键词

引用

@article{arxiv.2401.10521,
  title  = {Cross-lingual Editing in Multilingual Language Models},
  author = {Himanshu Beniwal and Kowsik Nandagopan D and Mayank Singh},
  journal= {arXiv preprint arXiv:2401.10521},
  year   = {2024}
}

备注

Accepted at EACL 2024