中文

面向机器翻译的语言学动机多维质量指标

计算与语言 2026-04-21 v1 人工智能

摘要

现有的机器翻译评估框架,包括自动评估指标和人类评估方案如多维质量指标(MQM),大多语言中立。然而,它们往往无法捕捉双语方言(如阿拉伯语)中特定于方言和文化的错误, 在此类语言中,翻译失败源于语言 variety、内容覆盖和语用恰当性之间的不匹配,而不仅仅是表层形式。我们引入 LQM:面向机器翻译的语言学动机多维质量指标。LQM 是一种分层错误分类体系,用于通过六个语言学基础层级诊断机器翻译错误:社会语言学、语用学、语义学、形态句法、正字法和字形美学学(图 1)。我们构建了一个包含 3,850 句子(每个 variety 550 句)的双向平行语料库,涵盖七种阿拉伯语方言(埃及方言、阿联酋方言、约旦方言、毛里塔尼亚方言、摩洛哥方言、巴勒斯坦方言和也门方言),源自对话和具有文化丰富性的内容。我们以零样本方式评估六个大型语言模型(LLM),并使用 LQM 进行专家范围级人类标注,产生 6,113 个标记错误范围跨 3,495 个唯一错误句子,以及加权质量评分。我们补充了自动评估指标(spBLEU)。虽然在阿拉伯语上进行了验证,但 LQM 是一种语言中立框架,旨在轻松应用于或适配其他语言。LQM 标注的数据、提示词和标注指南已公开于 https://github.com/UBC-NLP/LQM_MT。

关键词

引用

@article{arxiv.2604.18490,
  title  = {LQM: Linguistically Motivated Multidimensional Quality Metrics for Machine Translation},
  author = {Samar M. Magdy and Fakhraddin Alwajih and Abdellah El Mekki and Wesam El-Sayed and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2604.18490},
  year   = {2026}
}

备注

Accepted to ACL 2026; resources available at https://github.com/UBC-NLP/LQM_MT