SiniticMTError:面向四种语言的机器翻译数据集及错误标注
计算与语言
2026-03-18 v2
摘要
尽管近年来机器翻译(MT)取得了显著进展,但对于许多缺乏大规模训练数据和语言资源的低资源语言而言,进展仍有限。本文介绍了 \dsname,这是一个新颖的细粒度数据集,基于现有的平行语料库,为英译汉、粤语、吴语以及从非平行语料派生的汉闽组件的机器翻译示例提供错误片段、错误类型和错误严重程度标注。该数据集为MT社区提供资源,支持基于错误检测能力进行模型微调,涵盖翻译质量评估、错误感知生成和低资源语言评估等研究。我们还使用语言模型建立基线结果,以衡量翻译错误检测性能。具体而言,我们评估了多个开源和闭源大语言模型,采用片段级别和基于相关性的MQM指标,结果显示其精度有限,凸显了本数据集的必要性。最后,我们报告了由母语者执行的严格标注流程,包括初步研究分析、迭代反馈、见解以及错误类型和严重程度的模式。
引用
@article{arxiv.2509.20557,
title = {SiniticMTError: A Machine Translation Dataset with Error Annotations for Sinitic Languages},
author = {Hannah Liu and Junghyun Min and En-Shiun Annie Lee and Ethan Yue Heng Cheung and Shou-Yi Hung and Elsie Chan and Shiyao Qian and Runtong Liang and Kimlan Huynh and Wing Yu Yip and York Hay Ng and TSZ Fung Yau and Ka Ieng Charlotte Lo and You-Wei Wu and Richard Tzong-Han Tsai},
journal= {arXiv preprint arXiv:2509.20557},
year = {2026}
}
备注
LREC 2026 camera-ready. 23 pages, 2 figures, 11 tables