基于长上下文参考的机器翻译质量评估
计算与语言
2025-09-18 v1 机器学习
摘要
本文提出了我们提交给第十届机器翻译会议 (WMT25) 自动化翻译质量评估共享任务的系统。我们的系统基于 COMET 框架,训练以预测基于增强长上下文数据的分段级错误跨度注释 (ESA) 分数。为构建长上下文训练数据,我们拼接领域内的人工标注句子并计算其分数的加权平均。我们整合多个人类评判数据集 (MQM、SQM 和 DA),对其比例进行标准化,并训练多语言回归模型,从源语言、假设文本和参考翻译预测质量分数。实验结果表明,纳入长上下文信息的模型在与人类评判相关性方面优于仅使用短段训练的模型。
引用
@article{arxiv.2509.13980,
title = {Long-context Reference-based MT Quality Estimation},
author = {Sami Ul Haq and Chinonso Cynthia Osuji and Sheila Castilho and Brian Davis},
journal= {arXiv preprint arXiv:2509.13980},
year = {2025}
}