中文

Align-then-Slide:面向超长文档级机器翻译的完整评估框架

计算与语言 2025-09-05 v1 人工智能

摘要

大型语言模型(LLM)已为文档级机器翻译(doc-mt)带来新时代,但其全文档输出挑战了假设基于句子-句子对齐的现有评估方法。我们提出"Align-then-Slide"(对齐-滑动)框架,为超长 doc-mt 构建完整评估体系。在对齐阶段,我们自动推断句子级源-目标对应关系,并重建目标文本以匹配源句子数量,从而解决遗漏及许多对一/一对多映射。在 n-Chunk 滑动评估阶段,我们计算在 1、2、3 和 4 块上的平均指标分数,以实现多粒度评估。在 WMT 基准测试中,我们的方法与专家 MQM 排名之间的皮尔逊相关系数为 0.929。在新编的真实世界测试集上,该方法同样与人类判断高度一致。进一步地,Align-then-Slide 生成的偏好数据可用于有效的 CPO 训练,或直接作为 GRPO 的奖励模型使用,两者均产生优于基础 SFT 基线的翻译结果。结果表明,该框架是 doc-mt 系统的准确、稳健且可操作的评估工具。

关键词

引用

@article{arxiv.2509.03809,
  title  = {Align-then-Slide: A complete evaluation framework for Ultra-Long Document-Level Machine Translation},
  author = {Jiaxin Guo and Daimeng Wei and Yuanchang Luo and Xiaoyu Chen and Zhanglin Wu and Huan Yang and Hengchao Shang and Zongyao Li and Zhiqiang Rao and Jinlong Yang and Hao Yang},
  journal= {arXiv preprint arXiv:2509.03809},
  year   = {2025}
}

备注

under preview