翻译错误显著影响跨语言学习中的低资源语言
计算与语言
2024-02-06 v1
摘要
用于评估跨语言语言理解的流行基准(例如XNLI)由多个目标语言的英文评估集的平行版本组成,这些版本是在专业翻译人员的帮助下创建的。在创建此类平行数据时,确保所有目标语言的高质量翻译对于准确描述跨语言迁移至关重要。在这项工作中,我们发现翻译不一致确实存在,有趣的是,它们对XNLI中的低资源语言产生了不成比例的影响。为了识别这种不一致,我们提出测量在多个目标语言上,人工翻译和机器翻译的目标文本之间的零样本评估性能差距;相对较大的差距表明存在翻译错误。我们还通过对印地语和乌尔都语这两种目标语言的人工翻译测试实例进行手动重新标注,证实了翻译错误的存在,并发现这些实例与它们本应继承的原始英文标签的一致性较差。
引用
@article{arxiv.2402.02080,
title = {Translation Errors Significantly Impact Low-Resource Languages in Cross-Lingual Learning},
author = {Ashish Sunil Agrawal and Barah Fazili and Preethi Jyothi},
journal= {arXiv preprint arXiv:2402.02080},
year = {2024}
}
备注
Accepted to main proceedings of "The 18th Conference of the European Chapter of the Association for Computational Linguistics"