NSINA:僧伽罗语新闻语料库
计算与语言
2024-03-26 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)的引入推动了自然语言处理(NLP)的发展,但其有效性在很大程度上依赖于预训练资源。这在僧伽罗语等低资源语言中尤为明显,这些语言面临两个主要挑战:缺乏大量训练数据和有限的基准评测数据集。为此,本研究推出了 NSINA,一个包含来自热门僧伽罗语新闻网站超过 50 万篇文章的综合新闻语料库,以及三项 NLP 任务:新闻媒体识别、新闻类别预测和新闻标题生成。NSINA 的发布旨在为将 LLMs 适配到僧伽罗语的挑战提供解决方案,为改进僧伽罗语 NLP 提供宝贵的资源和基准。NSINA 是迄今为止最大的僧伽罗语新闻语料库。
引用
@article{arxiv.2403.16571,
title = {NSINA: A News Corpus for Sinhala},
author = {Hansi Hettiarachchi and Damith Premasiri and Lasitha Uyangodage and Tharindu Ranasinghe},
journal= {arXiv preprint arXiv:2403.16571},
year = {2024}
}
备注
Accepted to LREC-COLING 2024 (The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation)