利用改进的英乌机器翻译构建数据打印机
计算与语言
2024-07-15 v2
摘要
为了构建乌克兰语大语言模型,我们需要用大量以自然语言表达的新的算法任务来扩展我们的语料库。用英语表达的任务执行示例非常丰富,因此借助高质量的翻译系统,我们的社区将能够更快地整理数据集。为了助力这一目标,我们提出了一种构建翻译系统的方案:使用包含300万对乌克兰语和英语句子的含噪并行数据集,对大型预训练语言模型进行监督微调,随后在另一个质量更高的数据集上,使用通过k折困惑度过滤筛选出的1.7万个样本进行第二阶段训练。我们名为Dragoman的decoder-only模型在FLORES devtest测试集上的表现超越了此前最先进的encoder-decoder模型。
引用
@article{arxiv.2404.15196,
title = {Setting up the Data Printer with Improved English to Ukrainian Machine Translation},
author = {Yurii Paniv and Dmytro Chaplynskyi and Nikita Trynus and Volodymyr Kyrylov},
journal= {arXiv preprint arXiv:2404.15196},
year = {2024}
}
备注
Published at Proceedings of the Third Ukrainian Natural Language Processing Workshop (UNLP)@ LREC-COLING 2024 (pp. 41-50)