中文

llm-japanese-dataset v0:面向大语言模型的日语对话数据集构建及其方法

计算与语言 2023-05-23 v1 人工智能

摘要

本研究构建了一个用于微调大语言模型(LLMs)的日语对话数据集,包含约 840 万条记录。近来,LLMs 不断发展并日益普及。然而,高性能的 LLMs 通常主要以英语为主。这些 LLMs 支持英语以外语言的方式有两种:从零开始构建 LLM 或微调现有模型。但这两种方式中,数据集都是必要的组成部分。在本研究中,我们聚焦于让这些 LLMs 支持日语,并制作用于日语 LLM 训练或微调的数据集。我们构建的数据集包含多种任务,如翻译和知识类任务。在实验中,我们使用该数据集对现有 LLM 进行微调,并定性评估了其性能。结果表明,我们的数据集可能对 LLMs 有益。然而,我们也揭示了以英语以外语言构建 LLMs 所面临的一些困难。

关键词

引用

@article{arxiv.2305.12720,
  title  = {llm-japanese-dataset v0: Construction of Japanese Chat Dataset for Large Language Models and its Methodology},
  author = {Masanori Hirano and Masahiro Suzuki and Hiroki Sakaji},
  journal= {arXiv preprint arXiv:2305.12720},
  year   = {2023}
}

备注

12 pages