用于跨语言LLM适应的持续预训练:增强日语能力
计算与语言
2024-04-30 v1 人工智能
摘要
对最初在英语语料库上训练的大型语言模型(LLM)进行跨语言持续预训练,使我们能够利用海量的英语语言资源并降低预训练成本。在本研究中,我们通过扩展 Llama 2 的词表以包含日语字符,并在大型日语网络语料库上进行持续预训练,构建了具有增强日语能力的 LLM——Swallow。实验结果证实,通过持续预训练,日语任务的性能得到显著提升,并且性能随训练数据量的增加而单调提升,最高可达 100B tokens。因此,与从头开始用英语和日语训练的其他 LLM 相比,Swallow 取得了更优的性能。对持续预训练效果的分析表明,它对日语问答任务尤为有效。此外,为了阐明从英语到日语的跨语言持续预训练的有效方法,我们研究了词表扩展的影响以及引入平行语料库的有效性。结果表明,除摘要任务外,词表扩展带来的效率提升对性能没有负面影响,并且平行语料库的结合使用增强了翻译能力。
引用
@article{arxiv.2404.17790,
title = {Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities},
author = {Kazuki Fujii and Taishi Nakamura and Mengsay Loem and Hiroki Iida and Masanari Ohi and Kakeru Hattori and Hirai Shota and Sakae Mizuki and Rio Yokota and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2404.17790},
year = {2024}
}