LakotaBERT:面向低资源 Lakota 语言的Transformer模型
计算与语言
2025-03-25 v1 机器学习
摘要
Lakota 为美洲原住民部落的苏族人所使用的语言,面临年轻一代日益稀少的流利程度的挑战。本文介绍了 LakotaBERT,即首个针对 Lakota 语言的大型语言模型(LLM),旨在支持语言复兴努力。我们的研究有两个主要目标:(1) 创建一个全面的 Lakota 语言语料库;(2) 为 Lakota 开发定制化的 LLM。我们编译了一个包含 105K 句子的多样化语料库,涵盖 Lakota、English 以及平行文本,来自各类书籍和网站,强调 Lakota 语言的文化意义和历史背景。我们采用 RoBERTa 架构,对模型进行预训练,并对比评估了 RoBERTa、BERT 和多语言 BERT。初始结果显示,在单一 ground truth 假设下,遮蔽语言模型准确率达 51%,性能相当于英语模型。我们还使用额外指标(如精确率和 F1 分数)进行评估,以全面评估其能力。通过整合 AI 与语言学方法,我们期望增强语言多样性和文化韧性,为其他濒临灭绝的原住民语言复兴树立了有价值的先例。
引用
@article{arxiv.2503.18212,
title = {LakotaBERT: A Transformer-based Model for Low Resource Lakota Language},
author = {Kanishka Parankusham and Rodrigue Rizk and KC Santosh},
journal= {arXiv preprint arXiv:2503.18212},
year = {2025}
}