中文

将自动机器翻译评估扩展至章节长度文档

计算与语言 2025-09-23 v1

摘要

尽管大型语言模型 (LLM) 在翻译性能和长上下文能力方面表现出色,但评估方法仍受限于句子级评估,由于数据限制、指标的 token 数量限制以及刚性的句子边界要求。我们引入 SEGALE 评估方案,通过将文档视为连续文本并应用句子分段和对齐方法,将现有自动指标扩展到长文档翻译。我们的做法实现了先前不可达的文档级评估,能够处理任意长度翻译的生成,同时考虑下翻译和上翻译以及变化的句子边界。实验表明,我们的方案在现有长篇文档评估方案中显著优于表现,同时与使用真实句子对齐的评估相当。此外,我们将我们的方案应用于章节长度文本,新近演示许多开源 LLM 在其报告的最大上下文长度下未能有效翻译文档。

关键词

引用

@article{arxiv.2509.17249,
  title  = {Extending Automatic Machine Translation Evaluation to Book-Length Documents},
  author = {Kuang-Da Wang and Shuoyang Ding and Chao-Han Huck Yang and Ping-Chun Hsieh and Wen-Chih Peng and Vitaly Lavrukhin and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2509.17249},
  year   = {2025}
}

备注

Accepted for EMNLP 2025 main conference