中文

用于跨语言LLM适应的持续预训练:增强日语能力

计算与语言 2024-04-30 v1 人工智能

摘要

对最初在英语语料库上训练的大型语言模型(LLM)进行跨语言持续预训练,使我们能够利用海量的英语语言资源并降低预训练成本。在本研究中,我们通过扩展 Llama 2 的词表以包含日语字符,并在大型日语网络语料库上进行持续预训练,构建了具有增强日语能力的 LLM——Swallow。实验结果证实,通过持续预训练,日语任务的性能得到显著提升,并且性能随训练数据量的增加而单调提升,最高可达 100B tokens。因此,与从头开始用英语和日语训练的其他 LLM 相比,Swallow 取得了更优的性能。对持续预训练效果的分析表明,它对日语问答任务尤为有效。此外,为了阐明从英语到日语的跨语言持续预训练的有效方法,我们研究了词表扩展的影响以及引入平行语料库的有效性。结果表明,除摘要任务外,词表扩展带来的效率提升对性能没有负面影响,并且平行语料库的结合使用增强了翻译能力。

关键词

引用

@article{arxiv.2404.17790,
  title  = {Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities},
  author = {Kazuki Fujii and Taishi Nakamura and Mengsay Loem and Hiroki Iida and Masanari Ohi and Kakeru Hattori and Hirai Shota and Sakae Mizuki and Rio Yokota and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2404.17790},
  year   = {2024}
}