没有比更好的数据更像数据:使用QE指标进行机器翻译数据过滤
计算与语言
2023-11-10 v1
摘要
质量估计(QE)是在无需显式参考的情况下评估机器翻译输出的方法,近年来随着神经指标的使用取得了巨大进步。本文中我们分析使用QE指标过滤神经机器翻译系统(NMT)训练数据中劣质句对的可行性。尽管大多数语料过滤方法聚焦于检测文本集合(通常为大量网络爬取数据)中的噪声样本,QE模型训练用于判别更细粒度的质量差异。我们表明,通过选取训练数据中质量最高的句对,可在将训练规模减半的同时提升翻译质量。我们还提供了对过滤结果的详细分析,突出了两种方法间的差异。
引用
@article{arxiv.2311.05350,
title = {There's no Data Like Better Data: Using QE Metrics for MT Data Filtering},
author = {Jan-Thorsten Peter and David Vilar and Daniel Deutsch and Mara Finkelstein and Juraj Juraska and Markus Freitag},
journal= {arXiv preprint arXiv:2311.05350},
year = {2023}
}
备注
to be published at WMT23