多候选人人类后编辑机器翻译中的凭尾质量预测实验
计算与语言
2026-03-05 v1
摘要
本文研究两种互补的机器翻译(MT)质量预测范式:源侧难度预测和候选侧质量估计(QE)。大型语言模型(LLM)的快速引入正在重塑MT工作流程,但其对既 established质量预测范式的影响仍未充分探讨。我们通过一系列“凭尾”实验来研究此问题,该实验基于一个独特的、来自真实MT后编辑(MTPE)项目的数据集。该数据集包含6,000多个英文源段,来自多样化的传统神经MT系统和先进LLM的九个翻译假设,均针对单个最终人类后编辑参考进行评估。使用Kendall's秩相关系数,我们评估了源侧难度指标、候选侧QE模型和位置启发式方法对两种金标准分数的预测能力:TER(作为后编辑工作量的代理)和COMET(作为人类判断的代理)。我们的发现表明,向LLM架构的转变改变了既 established质量预测方法的可靠性,同时缓解了文档级翻译的先前挑战。
引用
@article{arxiv.2603.04083,
title = {Hindsight Quality Prediction Experiments in Multi-Candidate Human-Post-Edited Machine Translation},
author = {Malik Marmonier and Benoît Sagot and Rachel Bawden},
journal= {arXiv preprint arXiv:2603.04083},
year = {2026}
}
备注
Accepted to the 2026 Language Resources and Evaluation Conference (LREC)