Pragyaan:面向印度语言的高质量文化后训练数据集的设计与构建
计算与语言
2025-10-09 v1 人工智能
摘要
大语言模型(LLM)的有效性高度依赖于高质量后训练数据的可用性,特别是指令微调与基于偏好的示例。然而,现有的开源数据集通常缺乏多语言覆盖和文化根基,且任务多样性差距对印度语言尤为显著。我们引入了一种人机协作流水线,结合翻译与合成扩展,以生成可靠且多样化的印度语言后训练数据。利用该流水线,我们为10种印度语言构建了两个数据集:Pragyaan-IT(22.5K)和Pragyaan-Align(100K),涵盖13个大类与56个子类别,依托57个多样化数据集。我们的数据集协议纳入了多个常被忽视的维度,强调任务多样性、多轮对话、指令保真度、安全对齐和文化细微差别的保留,为更具包容性和有效性的多语言大语言模型奠定了基础。
引用
@article{arxiv.2510.07000,
title = {Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages},
author = {Neel Prabhanjan Rachamalla and Aravind Konakalla and Gautam Rajeev and Ashish Kulkarni and Chandra Khatri and Shubham Agarwal},
journal= {arXiv preprint arXiv:2510.07000},
year = {2025}
}
备注
EMNLP 2025