Llama-3-Nanda-10B-Chat:面向印地语的开放生成式大语言模型
计算与语言
2025-04-09 v1
摘要
为中等资源语言开发高质量的大语言模型(LLM)在数据可用性、模型适应性和评估方面提出了独特挑战。我们介绍了Llama-3-Nanda-10B-Chat(简称Nanda),一个最先进的以印地语为中心的指令微调生成式LLM,旨在突破开源印地语语言模型的边界。Nanda基于Llama-3-8B构建,采用Llama Pro方法,通过扩展Transformer块进行持续预训练。一个关键挑战是高质量印地语文本数据的有限可用性;我们通过严格的数据整理、增强和战略性双语训练(平衡印地语和英语语料库以优化跨语言知识迁移)解决了这一问题。拥有100亿参数,Nanda在同等规模的开源印地语和多语言模型中名列前茅,展现出对许多现有模型的显著优势。我们深入讨论了训练策略、微调技术、安全对齐和评估指标,展示了这些方法如何使Nanda取得最先进的结果。通过开源Nanda,我们旨在推动印地语LLM的研究,并支持学术界、工业界和公共服务领域的广泛实际应用。
引用
@article{arxiv.2504.06011,
title = {Llama-3-Nanda-10B-Chat: An Open Generative Large Language Model for Hindi},
author = {Monojit Choudhury and Shivam Chauhan and Rocktim Jyoti Das and Dhruv Sahnan and Xudong Han and Haonan Li and Aaryamonvikram Singh and Alok Anil Jadhav and Utkarsh Agarwal and Mukund Choudhary and Debopriyo Banerjee and Fajri Koto and Junaid Bhat and Awantika Shukla and Samujjwal Ghosh and Samta Kamboj and Onkar Pandit and Lalit Pradhan and Rahul Pal and Sunil Sahu and Soundar Doraiswamy and Parvez Mullah and Ali El Filali and Neha Sengupta and Gokul Ramakrishnan and Rituraj Joshi and Gurpreet Gosal and Avraham Sheinin and Natalia Vassilieva and Preslav Nakov},
journal= {arXiv preprint arXiv:2504.06011},
year = {2025}
}