中文

创意偏置:机器评估在文学翻译中的创意识别困境

计算与语言 2026-05-14 v1

摘要

本文探讨了自动评估指标(AEM)和LLM-as-a-judge评估在多语言、多体裁和多种翻译方式下的文学翻译性能。旨在评估这些工具在评估翻译、创意(创意性转变与错误)方面是否与专业人士一致,并且能否替代繁琐的手动标注。创建了一个涵盖三个翻译模态(人工翻译、机器翻译和后编辑)、三个体裁和三个语言对的文学翻译数据集,并由经验丰富的专业文学翻译家对创意进行详细标注。结果显示,自动评估指标和LLM-as-a-judge评估在创意方面与专业评估之间关联性较差,LLM-as-a-judge在机器翻译文本上表现出系统性偏好,并惩罚具有创意性和文化适当性的解决方案。此外,对于更文学化的体裁如诗歌,表现始终较差。这凸显了当前自动评估工具在文学翻译中的根本性局限性,以及需要创建不频繁将常规之外的翻译视为错误的新工具的需求。

关键词

引用

@article{arxiv.2605.13596,
  title  = {Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations},
  author = {Kyo Gerrits and Rik van Noord and Ana Guerberof Arenas},
  journal= {arXiv preprint arXiv:2605.13596},
  year   = {2026}
}

备注

This paper has been accepted to the EAMT Conference 2026 in Tilburg on June 15-18 2026