中文

QUAK:面向韩英神经机器翻译的合成质量估计数据集

计算与语言 2022-11-30 v2

摘要

随着近期神经机器翻译展现出其重要性,关于质量估计(QE)的研究在稳步进展。QE 旨在无需参考句的情况下自动预测机器翻译(MT)输出的质量。尽管其在现实世界中具有高度实用性,人工 QE 数据创建仍存在若干局限:因需要翻译专家而不可避免产生的大量成本,以及数据规模扩展与语言扩充方面的问题。为应对这些局限,我们提出 QUAK,一个以完全自动方式生成的韩英合成 QE 数据集。其由三个子 QUAK 数据集 QUAK-M、QUAK-P 与 QUAK-H 组成,通过三种相对不受语言约束的策略产生。由于各策略无需人力,便于扩展,我们将 QUAK-P、H 数据扩展至 1.58M,QUAK-M 扩展至 6.58M。作为实验,我们在进行统计分析的同时以多种方式定量分析了词级 QE 结果。此外,我们通过观察到 QUAK-M、P 在添加数据至 1.58M 时获得有意义的性能提升,表明以高效方式扩展的数据集亦有助于性能改进。

关键词

引用

@article{arxiv.2209.15285,
  title  = {QUAK: A Synthetic Quality Estimation Dataset for Korean-English Neural Machine Translation},
  author = {Sugyeong Eo and Chanjun Park and Hyeonseok Moon and Jaehyung Seo and Gyeongmin Kim and Jungseob Lee and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2209.15285},
  year   = {2022}
}