通过持续预训练和字典学习分析改进基于翻译数据训练的语言模型
计算与语言
2024-08-08 v2
摘要
训练低资源语言的LLM通常利用机器翻译(MT)从英语进行数据增强。然而,这给LLM训练带来了若干挑战:使用高端机器翻译解决方案翻译和策划大量内容成本高昂;翻译内容带有文化偏见;如果翻译不忠实准确,数据质量下降会导致训练模型出现问题。在本工作中,我们研究了翻译和合成数据在训练语言模型中的作用。我们将TinyStories(一个包含220万篇面向3-4岁儿童的短篇故事的数据集)从英语翻译成阿拉伯语,使用开源的NLLB-3B MT模型。我们使用这些数据训练了多个大小为1M-33M参数的故事生成模型。我们发现了结果模型中的若干质量和任务特定问题。为纠正这些问题,我们使用一个由能力强的LLM生成的小型高质量阿拉伯语故事合成数据集(占原始训练数据的1%)对模型进行进一步预训练。我们使用GPT-4作为评判者以及来自机械可解释性的字典学习分析表明,所提出的方法是解决某些机器翻译陷阱的实用手段。我们通过语言和文化偏见问题的案例研究展示了改进。
引用
@article{arxiv.2405.14277,
title = {Improving Language Models Trained on Translated Data with Continual Pre-Training and Dictionary Learning Analysis},
author = {Sabri Boughorbel and MD Rizwan Parvez and Majd Hawasly},
journal= {arXiv preprint arXiv:2405.14277},
year = {2024}
}
备注
16 pages