中文

通晓多语与否?度量基础模型中的多语言百科知识

计算与语言 2023-12-07 v2

摘要

在这项工作中,我们评估了基础模型在广泛语言语境中回忆百科知识的能力。为此,我们:1)构建了一个包含 20 种语言、303k 个事实关联及其反事实配对的数据集;2)在多语言测试中评估了 5 个模型;3)在英语-only 测试中基准测试了 24 个多样化的模型。Meta 的 LLaMA 在多语言与英语-only 评估中均取得最高分。然而,对 LLaMA 错误的分析揭示了其在英语以外语言回忆事实方面的显著局限,以及与被事实主体地点和性别相关的问题。总体而言,我们的发现表明当今的基础模型远非通晓多语者。

关键词

引用

@article{arxiv.2305.13675,
  title  = {Polyglot or Not? Measuring Multilingual Encyclopedic Knowledge in Foundation Models},
  author = {Tim Schott and Daniel Furman and Shreshta Bhat},
  journal= {arXiv preprint arXiv:2305.13675},
  year   = {2023}
}

备注

EMNLP 2023 (Main)