中文

Tagengo:一个多语言聊天数据集

计算与语言 2024-05-22 v1 人工智能 机器学习

摘要

开源大语言模型(LLM)近期取得了巨大进展。然而,许多此类模型仅关注流行的口语。我们提出了一个包含 74 种语言、超过 7 万个提示-响应对的高质量数据集,其中提示由人类生成,响应由合成生成。我们使用该数据集训练了一个最先进(SOTA)的开源英文 LLM 进行多语言聊天。我们在 6 种语言的 MT-Bench 聊天基准上评估了我们的模型,发现我们的多语言模型在每种语言上的表现均优于以往最先进的开源 LLM。我们进一步发现,与仅使用目标语言(日语)数据进行训练相比,在更多多语言数据上进行训练有利于提升该目标语言的性能。这些结果表明,有必要在大量高质量多语言数据上进行训练,以打造更具普及性的 LLM。

关键词

引用

@article{arxiv.2405.12612,
  title  = {Tagengo: A Multilingual Chat Dataset},
  author = {Peter Devine},
  journal= {arXiv preprint arXiv:2405.12612},
  year   = {2024}
}