UPDESH:用于 13 种印度语言的 grounding 指令调优数据的合成
计算与语言
2026-02-27 v3
摘要
发展文化依赖性的多语言 AI 系统仍具有挑战性,尤其是针对低资源语言。虽然合成数据有望解决这一问题,但其在多语言和多文化语境中的有效性尚未得到充分探索。我们采用基于大型开源大语言模型(参数量≥2350亿)的自下而上合成数据生成方法,辅以语言特定的维基百科内容,与主导性的从英文进行的自上而下翻译方法形成互补。我们引入 Updesh,构建了一个规模庞大且高质量的合成指令跟随数据集,涵盖 13 种印度语言和英语,包含多样化的推理与生成任务。通过自动化指标和 1 万人工评估进行全面评估,确认数据质量高。随后在多种数据集上进行微调,并在 13 个多样化多语言数据集和模型比较评估中测试表现,结果显示在 NLU、NLG 评估方面,训练 Updesh 的模型均取得显著提升。最后通过消融研究和文化评估,我们表明,具有情境感知性且符合文化背景的数据生成对有效的多语言 AI 开发至关重要。
关键词
引用
@article{arxiv.2509.21294,
title = {UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages},
author = {Pranjal A. Chitale and Varun Gumma and Sanchit Ahuja and Prashant Kodali and Manan Uppadhyay and Deepthi Sudharsan and Sunayana Sitaram},
journal= {arXiv preprint arXiv:2509.21294},
year = {2026}
}
备注
Under Review