中文

MetricX-25 与 GemSpanEval:Google Translate 提交至 WMT25 评估共享任务

计算与语言 2025-10-29 v1

摘要

本文介绍我们提交给统一 WMT25 Translation Evaluation Shared Task 的作品。对于质量分数预测子任务,我们构建了 MetricX 的新一代版本,在输入格式和训练协议方面进行了改进;对于错误片段检测子任务,我们开发了新的模型 GemSpanEval,通过在公开可用的 WMT 数据上进行微调,来预测错误片段及其严重程度和类别。两者都基于最先进的多语言开源权重模型 Gemma 3 进行微调。我们展示,MetricX-25 通过将 Gemma 3 适配为带有回归头的编码器架构,可以有效预测 MQM 和 ESA 质量评分,并且显著优于其前身。我们的解码器式 GemSpanEval 模型方面,我们表明其在错误片段检测任务中与 xCOMET(一个强大的编码器式序列标记基线)相抗衡。将错误片段检测形式化为生成任务后,GemSpanEval 还能输出每个预测错误片段的上下文,从而确保错误片段被明确识别。

关键词

引用

@article{arxiv.2510.24707,
  title  = {MetricX-25 and GemSpanEval: Google Translate Submissions to the WMT25 Evaluation Shared Task},
  author = {Juraj Juraska and Tobias Domhan and Mara Finkelstein and Tetsuji Nakagawa and Geza Kovacs and Daniel Deutsch and Pidong Wang and Markus Freitag},
  journal= {arXiv preprint arXiv:2510.24707},
  year   = {2025}
}

备注

Accepted to WMT25