The Box is in the Pen:评估神经机器翻译中的常识推理能力
计算与语言
2025-03-06 v1
摘要
神经机器翻译产生的译文是否符合常识?在本文中,我们提出了一套测试套件来评估神经机器翻译的常识推理能力。该测试套件包含三个测试集,涵盖需要常识知识来解决的词汇和上下文无关/上下文相关的句法歧义。我们手动创建了1200个三元组,每个三元组包含一个源句子和两个对比译文,涉及7种不同的常识类型。在大规模语料库上预训练的语言模型,如BERT、GPT-2,在该测试套件的目标译文上的常识推理准确率低于72%。我们在测试套件上进行了大量实验,评估神经机器翻译中的常识推理,并研究了影响该能力的因素。我们的实验和分析表明,神经机器翻译在三种歧义类型的常识推理方面表现不佳,无论是推理准确率(60.1%)还是推理一致性(31%)。构建的常识测试套件可在 https://github.com/tjunlp-lab/CommonMT 获取。
引用
@article{arxiv.2503.03308,
title = {The Box is in the Pen: Evaluating Commonsense Reasoning in Neural Machine Translation},
author = {Jie He and Tao Wang and Deyi Xiong and Qun Liu},
journal= {arXiv preprint arXiv:2503.03308},
year = {2025}
}
备注
EMNLP findings 2020