中文

面向文档级机器翻译的细粒度与多维度指标

计算与语言 2025-04-22 v4 人工智能

摘要

大型语言模型(LLMs)在包括机器翻译(MT)在内的各种NLP任务中表现出色,但大多数研究集中在句子级翻译。这项工作研究了经过指令微调的LLM在文档级翻译(docMT)方面的固有能力。与需要专门技术的先前方法不同,我们通过直接提示LLM一次性翻译整个文档来评估它们。我们的结果表明,与单独翻译句子相比,这种方法提高了翻译质量,即使没有进行文档级微调也是如此。然而,这种优势并未反映在BLEU分数中,BLEU分数通常更倾向于基于句子的翻译。我们建议使用LLM-as-a-judge范式进行评估,其中GPT-4用于以比基于n-gram的指标更细致的方式评估文档的连贯性、准确性和流畅性。总体而言,我们的工作表明,经过指令微调的LLM可以有效地利用文档上下文进行翻译。然而,我们提醒不要使用BLEU分数来评估docMT,因为它们常常提供误导性的结果,无法捕捉文档级翻译的质量。代码和GPT4-as-a-judge的输出可在https://github.com/EIT-NLP/BLEUless_DocMT获取。

关键词

引用

@article{arxiv.2410.20941,
  title  = {Fine-Grained and Multi-Dimensional Metrics for Document-Level Machine Translation},
  author = {Yirong Sun and Dawei Zhu and Yanjun Chen and Erjia Xiao and Xinghao Chen and Xiaoyu Shen},
  journal= {arXiv preprint arXiv:2410.20941},
  year   = {2025}
}

备注

Accepted at NAACL 2025 Student Research Workshop