面向极低资源芬尼-乌格语语言的大语言模型
计算与语言
2025-05-06 v2
摘要
大语言模型(LLM)的发展主要聚焦于高资源语言,导致芬尼-乌格语家族等低资源语言显著不足。本文致力于填补这一差距,聚焦于沃罗语、利沃诺语和科米语。我们涵盖了大约完整的LLM创建周期,从数据收集到指令调优和评估。我们的贡献包括开发多语言基础模型和指令调优模型;创建评估基准,包括smugri-MT-bench多轮对话基准;以及进行人类评估。我们希望此工作能促进语言多样性,确保较少资源的语言能够从NLP的进步中受益。
引用
@article{arxiv.2410.18902,
title = {LLMs for Extremely Low-Resource Finno-Ugric Languages},
author = {Taido Purason and Hele-Andra Kuulmets and Mark Fishel},
journal= {arXiv preprint arXiv:2410.18902},
year = {2025}
}