中文

PARAM-1 BharatGen 2.9B 模型

计算与语言 2025-07-21 v1 机器学习

摘要

大型语言模型 (LLM) 已成为强大的通用推理系统,但其发展仍以英语为中心,涵盖数据、架构和优化范式。这种排他性设计导致在印度等语言多样地区的结构性欠表现,印度拥有 20 多种官方语言和 100 多种方言,并存在代码切换和二语现象。我们引入 PARAM-1,一个 29 亿参数的解码器专用、纯文本语言模型,旨在以明确的架构和语言聚焦来关注印度的多样性。PARAM-1 在仅包含 Hindi 和 English 的双语数据集上从头训练,数据集以高质量、信息丰富内容为主。它遵循三个核心原则:通过 25% 语料比例实现印地语的平等表示;通过适应印度语言态学结构的 SentencePiece 分词器实现 tokenization 的公平性;以及在 IndicQA、代码混合推理和社会语言鲁棒性任务上进行文化对齐的评估基准。通过在预训练阶段嵌入多样性——而非在事后对齐中推迟——PARAM-1 提供了一种以设计为先的平等基础模型蓝图。我们的结果表明,它既是功能完善的通用模型,也是印度局部应用的稳健基线。

关键词

引用

@article{arxiv.2507.13390,
  title  = {PARAM-1 BharatGen 2.9B Model},
  author = {Kundeshwar Pundalik and Piyush Sawarkar and Nihar Sahoo and Abhishek Shinde and Prateek Chanda and Vedant Goswami and Ajay Nagpal and Atul Singh and Viraj Thakur and Vijay Dewane and Aamod Thakur and Bhargav Patel and Smita Gautam and Bhagwan Panditi and Shyam Pawar and Madhav Kotcha and Suraj Racha and Saral Sureka and Pankaj Singh and Rishi Bal and Rohit Saluja and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2507.13390},
  year   = {2025}
}