中文

通过比较判断提升机器翻译人类评估中的准确性

计算机视觉与模式识别 2025-04-07 v2

摘要

人类评估是评估快速发展的语言模型的关键,但受评注者熟练程度和任务设计的影响。本研究探讨了将比较判断集成到机器翻译(MT)的人类标注中的可能性,并评估了三种标注设置——单点多维质量指标(MQM)、并排MQM(SxS MQM)及其简化版本并排相对排序(SxS RR)。在MQM中,评注者按类别和严重程度标记错误片段。SxS MQM将MQM扩展到对同一输入的两个翻译进行成对错误标注,而SxS RR侧重于在不标记错误的前提下选择更好的输出。关键发现包括:(1)SxS设置实现了比MQM更高的评注者间一致性;(2)对于显式比较的MT系统,SxS MQM比MQM提高了平均38.5%的评注间错误标记一致性;(3)所有标注设置都返回稳定的系统排序,SxS RR为(SxS)MQM提供了更高效的替代方案;(4)SxS设置在不改变绝对系统评估的前提下,揭示了MQM中被忽略的细微错误。为推动进一步的研究,我们将发布由377个中英和104个英德标注示例组成的三重标注数据集。

关键词

引用

@article{arxiv.2502.17796,
  title  = {LAM: Large Avatar Model for One-shot Animatable Gaussian Head},
  author = {Yisheng He and Xiaodong Gu and Xiaodan Ye and Chao Xu and Zhengyi Zhao and Yuan Dong and Weihao Yuan and Zilong Dong and Liefeng Bo},
  journal= {arXiv preprint arXiv:2502.17796},
  year   = {2025}
}

备注

Project Page: https://aigc3d.github.io/projects/LAM/ Source code: https://github.com/aigc3d/LAM