多语言 TinyStories:面向小型语言模型的印度语言儿童故事合成语料库
计算与语言
2026-03-17 v1
摘要
稳健的低资源语言模型开发常受到高质量、连贯且领域适应的训练语料稀缺的制约。本文介绍了 Multilingual TinyStories 数据集,这是一个规模庞大的合成式儿童故事集合,涵盖 17 种印度语言。该语料库专为训练和评估小型语言模型(Small Language Models, SLMs)而设计,提供严格限定于本土脚本的简单叙事性文本。我们详细描述了混合式精选流程,利用 Sarvam-M 语言模型和 novel 组合化提示工程框架进行本土化生成,辅以 Google Translate API 实现大规模跨语言扩展。通过严格的程序化过滤,我们编译了 132,942 条故事,超过 9390 万 token,作为印度语言语境下多语言语言建模和迁移学习的基础资源。
引用
@article{arxiv.2603.14563,
title = {Multilingual TinyStories: A Synthetic Combinatorial Corpus of Indic Children's Stories for Training Small Language Models},
author = {Deepon Halder and Angira Mukherjee},
journal= {arXiv preprint arXiv:2603.14563},
year = {2026}
}