中文

缓解合成数据中的分布迁移问题:面向机器翻译质量评估

计算与语言 2025-06-19 v3

摘要

质量评估(QE)模型在无参考译文的情况下评估机器翻译质量,作为翻译任务的奖励模型。由于数据稀缺,合成数据生成已成为有前景的解决方案。然而,合成QE数据常常存在分布迁移问题,这种问题可能表现为伪译文与真实译文之间的差异,或伪标签与人类偏好不一致。为解决此问题,本文引入DCSQE框架,以缓解合成QE数据中的分布迁移。通过采用受限束搜索算法,并利用不同生成模型来增强译文多样性,以减少伪译文与真实译文之间的差异。DCSQE利用参考译文(即翻译监督信号)指导生成和标注过程,提高token级标签的质量。此外,DCSQE识别覆盖连续错误token的最短短语,模拟人类标注行为,以分配最终的短语级标签。特别地,我们强调翻译模型无法准确标注自身的译文。大量实验表明,DCSQE在监督和无监督设置下均优于CometKiwi等SOTA基线方法。进一步的分析提供了有关合成数据生成的见解,可为其他任务的奖励模型提供帮助。代码已公开于https://github.com/NJUNLP/njuqe。

关键词

引用

@article{arxiv.2502.19941,
  title  = {Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality Estimation},
  author = {Xiang Geng and Zhejian Lai and Jiajun Chen and Hao Yang and Shujian Huang},
  journal= {arXiv preprint arXiv:2502.19941},
  year   = {2025}
}

备注

ACL2025 Main