中文

多维机器翻译评估:面向韩语的模型评估与资源

计算与语言 2024-03-20 v1

摘要

几乎所有用于人工或自动评估机器翻译的框架都用单个数字来表征机器翻译输出的质量。多维质量度量框架是一个例外,它提供了一个细粒度的质量维度本体用于评分(如风格、流利度、准确性和术语)。先前的研究已经证明了 MQM 标注的可行性,但据我们所知,由于缺乏资源,目前尚无能够预测新文本 MQM 分数的计算模型。在本文中,我们通过 提供一个包含 1200 个句子的英韩语言对 MQM 评估基准,以及 将机器翻译评估重新定义为在基于参考的机器翻译评估设置和无参考的质量估计设置中,使用 SOTA 语言模型同时预测多个 MQM 分数的多任务问题,来解决这些不足。我们发现,无参考设置在风格维度上优于其对应设置,而基于参考的模型在准确性方面保持优势。总体而言,RemBERT 脱颖而出,成为最有前景的模型。通过我们的评估,我们提供了一种更细粒度、更易解释的方式来洞察翻译质量。

关键词

引用

@article{arxiv.2403.12666,
  title  = {Multi-Dimensional Machine Translation Evaluation: Model Evaluation and Resource for Korean},
  author = {Dojun Park and Sebastian Padó},
  journal= {arXiv preprint arXiv:2403.12666},
  year   = {2024}
}

备注

9 pages, accepted at LREC-COLING 2024