中文

面向十亿人口的克鲁特姆 LLM:多语言基础模型

计算与语言 2025-02-25 v2 人工智能

摘要

印度是一个社会多样性丰富、在 AI 系统开发中面临独特挑战的国家,包括语言多样性、口头传统、数据可访问性和可扩展性。现有的基础模型主要在英语上训练,限制了其为印度人口的有效性。尽管印度代表全球人口的 18%,但印度语言仅占 Common Crawl 语料库的 1%,导致语言偏见。数千种地区语言、方言和代码混合创造了额外的表示挑战 due to 稀疏训练数据。我们引入克鲁特姆 LLM,这是一个为印度的语言景观设计的 2 万亿 token 多语言模型。它包含已知最大的印度语言数据集,缓解了数据稀缺性,确保了方言间的平衡性能。克鲁特姆在印度语言基准测试中超越或匹配最先进的模型,同时保持竞争的英语性能。尽管在训练 flops 上显著小于克鲁特姆 LLM,但它在 16 个任务中 10 个任务上匹配或超过 LLAMA-2,平均得分 0.57 而 0.55。这证明了克鲁特姆在多样化语言语境中实现了灵活的多语言流畅度。克鲁特姆集成了实时搜索功能,以提高对话 AI 应用的事实准确性。这增强了为全球一亿人士提供的可及性。通过针对数据不平衡进行有意识的设计选择,克鲁特姆 LLM 在构建具有伦理性和全球代表性的 AI 模型方面取得了实质性的进展。

关键词

引用

@article{arxiv.2502.09642,
  title  = {Krutrim LLM: Multilingual Foundational Model for over a Billion People},
  author = {Aditya Kallappa and Palash Kamble and Abhinav Ravi and Akshat Patidar and Vinayak Dhruv and Deepak Kumar and Raghav Awasthi and Arveti Manjunath and Himanshu Gupta and Shubham Agarwal and Kumar Ashish and Gautam Bhargava and Chandra Khatri},
  journal= {arXiv preprint arXiv:2502.09642},
  year   = {2025}
}