中文

大语言模型中的跨语言知识编辑

计算与语言 2024-05-31 v2 人工智能

摘要

知识编辑旨在通过向语言模型中注入相应的期望知识,改变其在若干特殊案例(即编辑范围)上的表现。随着大语言模型(LLMs)近期的进展,知识编辑已被证明是一种无需从头重训即可使 LLMs 适应新前景的技术。然而,以往研究大多忽视了部分主流 LLMs(如 LLaMA、ChatGPT 与 GPT-4)的多语特性,通常聚焦于单语场景,即 LLMs 在同一语言中被编辑与评估。因此,源语言编辑对不同目标语言的影响仍属未知。本文旨在厘清知识编辑中的这一跨语言效应。具体而言,我们首先通过将 ZsRE 从英文翻译为中文,收集大规模跨语言合成数据集。随后,我们在涵盖不同范式的多种知识编辑方法上开展英文编辑,并在中文中评估其表现,反之亦然。为深入分析跨语言效应,评估涵盖可靠性、泛化性、局部性与可迁移性四个方面。此外,我们分析了被编辑模型的不一致行为并讨论其具体挑战。数据与代码见 https://github.com/krystalan/Bi_ZsRE

关键词

引用

@article{arxiv.2309.08952,
  title  = {Cross-Lingual Knowledge Editing in Large Language Models},
  author = {Jiaan Wang and Yunlong Liang and Zengkui Sun and Yuxuan Cao and Jiarong Xu and Fandong Meng},
  journal= {arXiv preprint arXiv:2309.08952},
  year   = {2024}
}

备注

Accepted to ACL 2024 main conference