超越标量分数:面向机器翻译错误感知质量估计的强化学习
计算与语言
2026-02-10 v1
摘要
质量估计旨在无需依赖参考译文即可评估机器翻译输出的质量,这对于现实世界中的大规模机器翻译评估至关重要。大型语言模型在推进机器翻译质量估计领域方面显示出巨大潜力。然而,大多数质量估计方法仅依赖标量质量分数,未能提供关于应驱动这些判断的翻译错误的明确信息。此外,对于标注质量估计数据有限的低资源语言,现有方法难以实现可靠的性能。为了解决这些挑战,我们引入了首个面向英语到马拉雅拉姆语(质量估计领域中一个严重资源匮乏的语言对)的片段级质量估计数据集,该数据集包含人工标注的直接评估分数和翻译质量评语,后者是描述翻译错误的简短、上下文相关的自由格式注释。我们进一步引入了ALOPE-RL,这是一个基于策略的强化学习框架,它基于从直接评估分数和翻译质量评语中得出的策略奖励来训练高效的适配器。将错误感知奖励与ALOPE-RL相结合,使大型语言模型能够超越数值分数来推理翻译质量。尽管在小型质量估计数据集上训练,ALOPE-RL在使用通过LoRA和4位量化微调的紧凑型大型语言模型(参数≤4B)时,在英语到马拉雅拉姆语的质量估计任务上达到了最先进的性能,超越了基于更大语言模型的基线和领先的基于编码器的质量估计模型。我们的结果表明,在有限的数据和计算预算下,错误感知的、基于策略的学习可以带来强大的质量估计性能。我们发布了我们的数据集、代码和训练好的模型,以支持未来的研究。
引用
@article{arxiv.2602.08600,
title = {Beyond Scalar Scores: Reinforcement Learning for Error-Aware Quality Estimation of Machine Translation},
author = {Archchana Sindhujan and Girish A. Koushik and Shenbin Qian and Diptesh Kanojia and Constantin Orăsan},
journal= {arXiv preprint arXiv:2602.08600},
year = {2026}
}
备注
Currently this article is under review for Natural Language Processing Journal