忍无可忍,尚需更多:翻译系统对消歧上下文是否敏感?
计算与语言
2023-10-24 v1
摘要
歧义文本的翻译对翻译系统而言是一项挑战,因为这需要尽可能利用周边上下文来消歧出预期含义。尽管已有研究探讨了由源语言与目标语言不同语法特征导致的歧义,我们研究源语言自身(本文为英语)中存在的语义歧义。具体而言,我们关注既可作字面解释又可作比喻解释(如 goose egg)的习语,并收集了 TIDE 数据集,包含 512 对含有消歧上下文的英语句子,其中一句为字面义(it laid a goose egg),另一句为比喻义(they scored a goose egg,即得分为零)。在实验中,我们比较了机器翻译专用模型与语言模型在以下方面的表现:(i)给定歧义子句时的偏好,(ii)对消歧上下文的敏感性,以及(iii)比喻义与字面义源句之间的性能差异。我们发现,即便上下文暗示比喻义解释,当前 MT 模型仍一贯按字面义翻译英语习语。另一方面,LM 对上下文的感知远强,尽管不同目标语言间仍存在差异。我们的发现凸显了 LM 作为上下文感知翻译强大骨干的潜力。
引用
@article{arxiv.2310.14610,
title = {That was the last straw, we need more: Are Translation Systems Sensitive to Disambiguating Context?},
author = {Jaechan Lee and Alisa Liu and Orevaoghene Ahia and Hila Gonen and Noah A. Smith},
journal= {arXiv preprint arXiv:2310.14610},
year = {2023}
}
备注
EMNLP 2023 Findings