区域性小故事:利用小模型比较语言学习与分词器性能
计算与语言
2025-04-23 v2 人工智能
摘要
小语言模型(SLM)为特定领域的 LLM 提供了高效的替代方案。2023 年的 TinyStories 研究开发了一个英语数据集,使具有 1 到 1000 万参数的 SLM 能够产生连贯的输出。我们的研究通过将原始数据集翻译成印度语言并使用 LLM 创建合成数据来扩展这一框架。我们重点关注印地语、马拉地语和孟加拉语,评估 SLM 在区域语言处理方面的能力并理解其语言复杂性。我们表明,SLM 能够以远少于 LLM 的参数高效处理区域语言,为分词策略和语言复杂性的“基于推理的评估”提供了一个互补框架。我们的分析表明,针对特定语言的分词器在处理印度语言时优于通用分词器。在信息论和形态学分析的支持下,实证验证为印地语模型优于马拉地语和孟加拉语模型的性能提供了基础性理解。此外,我们表明合成数据集在训练 SLM 方面优于翻译内容。相关性分析揭示了跨语言模式以及创造力、语法精确度和叙事完整性之间特定于语言的关系。这些发现推进了 SLM 在服务不足语言中的实际应用,以及我们对神经语言发展的理论理解。
引用
@article{arxiv.2504.07989,
title = {Regional Tiny Stories: Using Small Models to Compare Language Learning and Tokenizer Performance},
author = {Nirvan Patil and Malhar Abhay Inamdar and Agnivo Gosai and Guruprasad Pathak and Anish Joshi and Aryan Sagavekar and Anish Joshirao and Raj Dandekar and Rajat Dandekar and Sreedath Panat},
journal= {arXiv preprint arXiv:2504.07989},
year = {2025}
}
备注
34 pages, 24 figures, 16 tables