衡量多语言知识探测基准测试中语气干扰的影响
计算与语言
2025-10-20 v1
摘要
对于多语言事实知识评估,诸如 MLAMA 之类的基准测试使用模板翻译,而不考虑所插入命名实体的语法和语义信息。这导致大量不规范或错误的句子用法,尤其是对于形态丰富的语言,使得分解释复杂化。本文我们从 MLAMA 数据集中抽样 4 个斯拉夫语语言,比较初始(模板化)MLAMA 数据集与其由 Google Translate 和 ChatGPT 进行的句子级翻译之间的知识检索得分。我们观察到知识检索得分显著提高,并提供对可能导致其中的原因的定性分析。我们还对 5 个来自不同语言族的语言进行额外分析,发现类似模式。因此,我们鼓励社区控制高度多语言数据集的语法正确性,以获得更高且更可解释的结果,这通过神经机器翻译或 LLM 系统的整句翻译得以近似。该数据集及所有相关代码已发布于 Github 仓库:https://github.com/ZurichNLP/Fluent-mLAMA
引用
@article{arxiv.2510.15115,
title = {Measuring the Effect of Disfluency in Multilingual Knowledge Probing Benchmarks},
author = {Kirill Semenov and Rico Sennrich},
journal= {arXiv preprint arXiv:2510.15115},
year = {2025}
}