中文

大语言模型有效利用文档级上下文进行文学翻译,但关键错误依然存在

计算与语言 2023-05-24 v3

摘要

大语言模型(LLMs)在广泛的句子级翻译数据集上可与最先进水平竞争。然而,它们翻译段落和文档的能力仍未被探索,因为在这些场景下的评估成本高且困难。我们通过严格的人工评估表明,要求 Gpt-3.5(text-davinci-003)LLM 一次性翻译整个文学段落(例如小说中的段落)在 18 个语言对(例如涉及日语、波兰语和英语的互译)中比标准的逐句翻译产生更高质量的译文。我们的评估用于标注和分析约耗费 350 小时,通过雇佣源语言与目标语言均流利的译者,并请他们提供跨度级错误标注以及对哪个系统翻译更好的偏好判断来进行。我们观察到,语篇级 LLM 翻译器比句子级方法犯下更少的误译、语法错误和风格不一致。即便如此,关键错误仍然大量存在,包括偶尔的内容遗漏,且仍需人工译者的介入以确保作者声音得以保留。我们公开发布数据集与错误标注以推动未来关于文档级文学翻译评估的研究。

关键词

引用

@article{arxiv.2304.03245,
  title  = {Large language models effectively leverage document-level context for literary translation, but critical errors persist},
  author = {Marzena Karpinska and Mohit Iyyer},
  journal= {arXiv preprint arXiv:2304.03245},
  year   = {2023}
}

备注

preprint (31 pages)