中文

忍无可忍,尚需更多:翻译系统对消歧上下文是否敏感?

计算与语言 2023-10-24 v1

摘要

歧义文本的翻译对翻译系统而言是一项挑战,因为这需要尽可能利用周边上下文来消歧出预期含义。尽管已有研究探讨了由源语言与目标语言不同语法特征导致的歧义,我们研究源语言自身(本文为英语)中存在的语义歧义。具体而言,我们关注既可作字面解释又可作比喻解释(如 goose egg)的习语,并收集了 TIDE 数据集,包含 512 对含有消歧上下文的英语句子,其中一句为字面义(it laid a goose egg),另一句为比喻义(they scored a goose egg,即得分为零)。在实验中,我们比较了机器翻译专用模型与语言模型在以下方面的表现:(i)给定歧义子句时的偏好,(ii)对消歧上下文的敏感性,以及(iii)比喻义与字面义源句之间的性能差异。我们发现,即便上下文暗示比喻义解释,当前 MT 模型仍一贯按字面义翻译英语习语。另一方面,LM 对上下文的感知远强,尽管不同目标语言间仍存在差异。我们的发现凸显了 LM 作为上下文感知翻译强大骨干的潜力。

关键词

引用

@article{arxiv.2310.14610,
  title  = {That was the last straw, we need more: Are Translation Systems Sensitive to Disambiguating Context?},
  author = {Jaechan Lee and Alisa Liu and Orevaoghene Ahia and Hila Gonen and Noah A. Smith},
  journal= {arXiv preprint arXiv:2310.14610},
  year   = {2023}
}

备注

EMNLP 2023 Findings