中文

文档级别翻译的质量估计重排序

计算与语言 2025-10-13 v1

摘要

质量估计(QE)重排序是一种质量感知解码形式,旨在通过评分和选择从生成的翻译候选池中挑选出最佳译文来提高机器翻译(MT)质量。虽然在句子级别已知效果良好,但其应用于日益突出的文档级翻译领域仍鲜有探索。在本工作中,我们在文档级别(而非典型的句子级别)上评估QE重排序性能,使用各种学习型和大型语言模型(LLM)基于的QE指标。我们发现,利用我们最佳的学习型指标SLIDE,BLEURT-20得分在仅有两个候选译文时提升+2.00,在32个候选译文时提升+5.09,无论是解码器-only LLM模型还是编码器-解码器神经机器翻译(NMT)模型。使用最佳LLM基于的指标GEMBA-DA,同样条件下分别实现+1.63和+4.30的提升。尽管随输入长度增加而缩小收益,但在32个候选译文的重排序在最长文档(512-1024源标记)上分别实现+2.34(SLIDE)和+1.40(GEMBA-DA)的改进。这些发现表明,文档级别QE在实际中具有价值,仅需合适的翻译模型和硬件即可实现最小运行开销。

关键词

引用

@article{arxiv.2510.08870,
  title  = {Quality Estimation Reranking for Document-Level Translation},
  author = {Krzysztof Mrozinski and Minji Kang and Ahmed Khota and Vincent Michael Sutanto and Giovanni Gatti De Giacomo},
  journal= {arXiv preprint arXiv:2510.08870},
  year   = {2025}
}

备注

9 pages, 4 figures