中文

通过持续预训练构建面向金融领域的日语大语言模型

计算与语言 2024-04-17 v1 计算金融

摘要

大语言模型(LLMs)现已广泛应用于包括金融在内的各个领域。然而,专门针对日语金融领域的LLM尚未被提出。因此,本研究旨在通过持续预训练构建一个日语金融专用LLM。在微调之前,我们构建了用于持续预训练的日语金融数据集。作为基础模型,我们采用了一个在日语金融基准测试中达到百亿参数模型中最先进性能的日语LLM。使用这些数据集和基础模型进行持续预训练后,微调后的模型在日语金融基准测试上的表现优于原始模型。此外,输出对比结果显示,微调模型的输出在答案质量和长度方面往往优于原始模型。这些发现表明,领域特定的持续预训练对LLM也是有效的。微调后的模型已在Hugging Face上公开。

关键词

引用

@article{arxiv.2404.10555,
  title  = {Construction of Domain-specified Japanese Large Language Model for Finance through Continual Pre-training},
  author = {Masanori Hirano and Kentaro Imajo},
  journal= {arXiv preprint arXiv:2404.10555},
  year   = {2024}
}

备注

7 pages