中文

构建面向大语言模型的大型日语网络语料库

计算与语言 2024-04-30 v1 人工智能

摘要

开放的日语大语言模型(LLM)在 CC-100、mC4 和 OSCAR 等语料库的日语部分上进行了训练。然而,这些语料库并非出于日语文本质量的目的而创建。本研究通过从 Common Crawl 存档(包含 2020 年至 2023 年间抓取的约 634 亿页面的 21 个快照)中提取和精炼文本,构建了一个大型日语网络语料库。该语料库包含约 3121 亿字符(约 1.73 亿页面),是所有可用于日语 LLM 训练的语料库中规模最大的,超过了 CC-100(约 258 亿字符)、mC4(约 2397 亿字符)和 OSCAR 23.10(约 74 亿字符)。为确认语料库质量,我们以 Llama 2 7B、13B、70B、Mistral 7B v0.1 和 Mixtral 8x7B Instruct 作为基础 LLM 进行了持续预训练,并在日语基准数据集上获得了一致的提升(6.6-8.1 分)。我们还证明,该语料库为 Llama 2 13B 带来的提升在现有其他语料库中是最大的。

关键词

引用

@article{arxiv.2404.17733,
  title  = {Building a Large Japanese Web Corpus for Large Language Models},
  author = {Naoaki Okazaki and Kakeru Hattori and Hirai Shota and Hiroki Iida and Masanari Ohi and Kazuki Fujii and Taishi Nakamura and Mengsay Loem and Rio Yokota and Sakae Mizuki},
  journal= {arXiv preprint arXiv:2404.17733},
  year   = {2024}
}

备注

17 pages