中文

IndicLLMSuite:为印度语言创建预训练与微调数据集的蓝图

计算与语言 2024-12-02 v2

摘要

尽管英语 LLM 取得了巨大进展,但由于缺乏量身定制的资源,其他语言在构建可比模型方面的进展受到了阻碍。我们的工作旨在通过引入一套专门为印度语言 LLM 开发而设计的广泛资源来弥合这一差距,涵盖 22 种语言,包含总计 251B 个 token 和 74.8M 个指令-响应对。认识到数据质量和数量的重要性,我们的方法结合了高度精选的人工验证数据、未经验证但有价值的数据以及合成数据。我们构建了一个干净的开源流水线,用于从网站、PDF 和视频等多种来源整理预训练数据,并融入了抓取、清理、标记和去重等最佳实践。对于指令微调,我们合并了现有的印度语言数据集,将英语数据集翻译/音译为印度语言,并利用 LLaMa2 和 Mixtral 模型基于印度语 Wikipedia 和 Wikihow 文章创建对话。此外,我们通过为多种场景生成有毒提示,然后将这些有毒提示输入到对齐的 LLaMa2 模型以生成无毒响应,从而解决毒性对齐问题。我们希望作为这项工作一部分发布的数据集、工具和资源不仅能推动印度语言 LLM 的研究和开发,还能为将此类努力扩展到其他语言建立一个开源蓝图。作为这项工作一部分创建的数据和其他工件均以宽松的许可证发布。

关键词

引用

@article{arxiv.2403.06350,
  title  = {IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian Languages},
  author = {Mohammed Safi Ur Rahman Khan and Priyam Mehta and Ananth Sankar and Umashankar Kumaravelan and Sumanth Doddapaneni and Suriyaprasaad B and Varun Balan G and Sparsh Jain and Anoop Kunchukuttan and Pratyush Kumar and Raj Dabre and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2403.06350},
  year   = {2024}
}

备注

ACL-2024 Outstanding Paper