中文

The Box is in the Pen:评估神经机器翻译中的常识推理能力

计算与语言 2025-03-06 v1

摘要

神经机器翻译产生的译文是否符合常识?在本文中,我们提出了一套测试套件来评估神经机器翻译的常识推理能力。该测试套件包含三个测试集,涵盖需要常识知识来解决的词汇和上下文无关/上下文相关的句法歧义。我们手动创建了1200个三元组,每个三元组包含一个源句子和两个对比译文,涉及7种不同的常识类型。在大规模语料库上预训练的语言模型,如BERT、GPT-2,在该测试套件的目标译文上的常识推理准确率低于72%。我们在测试套件上进行了大量实验,评估神经机器翻译中的常识推理,并研究了影响该能力的因素。我们的实验和分析表明,神经机器翻译在三种歧义类型的常识推理方面表现不佳,无论是推理准确率(60.1%)还是推理一致性(31%)。构建的常识测试套件可在 https://github.com/tjunlp-lab/CommonMT 获取。

关键词

引用

@article{arxiv.2503.03308,
  title  = {The Box is in the Pen: Evaluating Commonsense Reasoning in Neural Machine Translation},
  author = {Jie He and Tao Wang and Deyi Xiong and Qun Liu},
  journal= {arXiv preprint arXiv:2503.03308},
  year   = {2025}
}

备注

EMNLP findings 2020