AI辅助的人类机器翻译评估
计算与语言
2025-01-30 v3
摘要
研究团队每年都要大量支出来评估机器翻译系统(如WMT等)的质量,这需要大量的专业人力。由于在新采用的注释协议(Error Span Annotation, ESA)中,注释员需要扫描翻译以查找可能的错误,这是一项昂贵且耗时的工作。本文通过在错误注释中预填充基于召回率的自动质量估计,帮助注释员完成工作。借助AI辅助,我们在保持相同质量水平的同时,将每个错误跨度注释的时间缩短一半(71秒/错误跨度→31秒/错误跨度)。ESA协议的最大优势在于对注释员进行准确的预热(预填充错误跨度),从而缓解了潜在的自动化偏差——我们证实了该偏差较低。在实验中,我们发现通过筛选AI认为可能正确的样本,还能进一步将注释预算降低近25%。
引用
@article{arxiv.2406.12419,
title = {AI-Assisted Human Evaluation of Machine Translation},
author = {Vilém Zouhar and Tom Kocmi and Mrinmaya Sachan},
journal= {arXiv preprint arXiv:2406.12419},
year = {2025}
}
备注
NAACL 2025