中文

LIMBA:利用生成式模型保护与活化低资源语言的开源框架

计算与语言 2024-11-21 v1 人工智能

摘要

少数民族语言对保护文化遗产至关重要,但由于数字资源有限以及基于高资源语言训练的人工智能模型占据主导地位,它们面临着日益严重的灭绝风险。本白皮书提出了一个为低资源语言生成语言工具的框架,重点关注数据创建,以支持能够辅助语言保护工作的语言模型的开发。以濒危语言撒丁语作为案例研究,展示该框架的有效性。通过解决阻碍此类语言智能应用的数据稀缺问题,我们致力于促进语言多样性,并支持通过现代技术进行语言标准化和复兴的持续努力。

关键词

引用

@article{arxiv.2411.13453,
  title  = {LIMBA: An Open-Source Framework for the Preservation and Valorization of Low-Resource Languages using Generative Models},
  author = {Salvatore Mario Carta and Stefano Chessa and Giulia Contu and Andrea Corriga and Andrea Deidda and Gianni Fenu and Luca Frigau and Alessandro Giuliani and Luca Grassi and Marco Manolo Manca and Mirko Marras and Francesco Mola and Bastianino Mossa and Piergiorgio Mura and Marco Ortu and Leonardo Piano and Simone Pisano and Alessia Pisu and Alessandro Sebastian Podda and Livio Pompianu and Simone Seu and Sandro Gabriele Tiddia},
  journal= {arXiv preprint arXiv:2411.13453},
  year   = {2024}
}