HOPE:一种基于专业译后编辑、面向任务且以人为中心的机器翻译评估框架
计算与语言
2021-12-28 v1 人工智能
摘要
传统的机器翻译自动评估指标因准确率低、缺乏透明度、关注语言机制而非语义、以及与人工质量评估一致性低而广受语言学家批评。以类 MQM 记分卡形式的人工评估一直由客户和翻译服务提供商(TSPs)在真实工业环境中开展。然而,传统人工翻译质量评估成本高昂且深入语言细节,引发评分者间可靠性(IRR)问题,且并非为衡量低于优质质量的翻译而设计。在本工作中,我们引入 HOPE,一种基于专业译后编辑标注、面向任务且以人为中心的机器翻译输出评估框架。它仅包含有限数量的常见错误类型,并采用具有错误惩罚点(EPPs)几何级数递增的评分模型,将错误严重程度映射到每个翻译单元。在高度技术领域的营销类文本英俄语言对 MT 输出上开展的初步实验表明,我们的评估框架在系统级整体性能和句段级透明度方面均能有效地反映 MT 输出质量,并提高了错误类型判定的 IRR。该方法具有若干关键优势,例如能够衡量和比较不同系统低于完美的 MT 输出、能够指示人类对质量的感知、即时估计将 MT 输出提升至优质质量所需的人工投入、低成本与更快速应用,以及更高的 IRR。我们的实验数据可在 \url{https://github.com/lHan87/HOPE} 获取。
引用
@article{arxiv.2112.13833,
title = {HOPE: A Task-Oriented and Human-Centric Evaluation Framework Using Professional Post-Editing Towards More Effective MT Evaluation},
author = {Serge Gladkoff and Lifeng Han},
journal= {arXiv preprint arXiv:2112.13833},
year = {2021}
}
备注
5 figures, 9 pages