翻译质量测量的多范围理论:MQM 评分模型与统计质量控制
计算与语言
2024-08-06 v5 应用统计
摘要
2024 年是用于分析性翻译质量评估的多维质量指标(MQM)框架诞生 10 周年。MQM 错误类型学已被翻译和本地化行业的从业者广泛使用,并已成为许多衍生项目的基础。年度机器翻译会议(WMT)关于人工和自动翻译质量评估的共享任务都使用了 MQM 错误类型学。该指标建立在两个支柱上:错误类型学和评分模型。评分模型根据标注数据计算质量分数,详细说明了如何将错误类型和严重性计数转换为数字分数,以确定内容是否符合规范。此前,只有原始评分模型被公开。今年四月,MQM 委员会发布了线性校准评分模型,本文正式介绍该模型,以及此前未公开的非线性评分模型。本文详细介绍了 MQM 的最新发展,并提出了一种适用于三个样本量范围的通用翻译质量测量方法。它还解释了为什么对于非常小的样本量(从单个句子开始)应使用统计质量控制。
引用
@article{arxiv.2405.16969,
title = {The Multi-Range Theory of Translation Quality Measurement: MQM scoring models and Statistical Quality Control},
author = {Arle Lommel and Serge Gladkoff and Alan Melby and Sue Ellen Wright and Ingemar Strandvik and Katerina Gasova and Angelika Vaasa and Andy Benzo and Romina Marazzato Sparano and Monica Foresi and Johani Innis and Lifeng Han and Goran Nenadic},
journal= {arXiv preprint arXiv:2405.16969},
year = {2024}
}
备注
Accepted by AMTA2024