引入NewsPaLM MBR与QE数据集:LLM生成的高质量平行数据优于传统网络爬取数据
计算与语言
2024-11-26 v5
摘要
神经机器翻译 (NMT) 的最新研究表明,在高质量机器生成数据上进行训练可以优于在人工生成数据上进行训练。本工作首次发布了 LLM 生成、MBR 解码和 QE 重排的 dataset,包含句子级和多句子示例。我们进行了大量实验,以展示我们的 dataset 在下游 NMT 模型性能方面的质量。我们发现,从头开始在我们的(机器生成的)dataset 上训练优于在(网络爬取的)WMT'23 训练 dataset(其规模大 300 倍)上训练,也优于在 WMT'23 训练 dataset 的最高质量子集上训练。我们还发现,通过微调生成该 dataset 的 LLM 进行自蒸馏,优于该 LLM 强大的少样本基线。这些发现证实了我们 dataset 的质量,并展示了高质量机器生成数据在提升 NMT 模型性能方面的价值。
引用
@article{arxiv.2408.06537,
title = {Introducing the NewsPaLM MBR and QE Dataset: LLM-Generated High-Quality Parallel Data Outperforms Traditional Web-Crawled Data},
author = {Mara Finkelstein and David Vilar and Markus Freitag},
journal= {arXiv preprint arXiv:2408.06537},
year = {2024}
}