中文

跨越阈值:通过检索增强与损失加权实现惯用语机器翻译

计算与语言 2023-10-24 v2

摘要

惯用语在日常语言中很常见,但常给译者带来挑战,因为其含义并非由其组成部分的含义推导而来。尽管取得显著进展,机器翻译系统仍难以翻译惯用表达。我们提供了对惯用语翻译及相关问题的简单刻画。这使我们能够开展一项合成实验,揭示基于transformer的机器翻译模型正确默认采用惯用语翻译的临界点。为扩展多语言资源,我们编译了一个包含约4k个法语、芬兰语和日语中含有惯用表达的自然句子数据集。为改进自然惯用语的翻译,我们引入两种直接而有效的技术:对潜在惯语句子的训练损失进行策略性升权,以及使用检索增强模型。这不仅将强预训练MT模型在惯语句上的绝对准确率提高至多13%,也对非惯语句具有潜在益处。

关键词

引用

@article{arxiv.2310.07081,
  title  = {Crossing the Threshold: Idiomatic Machine Translation through Retrieval Augmentation and Loss Weighting},
  author = {Emmy Liu and Aditi Chaudhary and Graham Neubig},
  journal= {arXiv preprint arXiv:2310.07081},
  year   = {2023}
}

备注

EMNLP 2023