中文

L3Cube-MahaNews:基于新闻的马拉地语短文本和长文档分类数据集

计算与语言 2024-04-30 v1 机器学习

摘要

低资源语言马拉地语的文本或主题分类数据集可用性有限,通常包含少于4个目标标签,有些甚至达到近乎完美的准确率。在这项工作中,我们介绍了L3Cube-MahaNews,一个专注于新闻标题和文章的马拉地语文本分类语料库。该语料库是最大的监督式马拉地语语料库,包含超过10.5万条记录,分为12个不同类别。为了适应不同的文档长度,MahaNews包含三个专门为短文本、长文档和中等段落设计的监督数据集。这些数据集之间一致的标签便于基于文档长度的分析。我们提供了详细的数据统计信息,并使用最先进的预训练BERT模型在这些数据集上给出了基线结果。我们对单语和多语BERT模型(包括MahaBERT、IndicBERT和MuRIL)进行了比较分析。单语MahaBERT模型在所有数据集上均优于其他模型。这些资源也可作为马拉地语主题分类数据集或模型,并在https://github.com/l3cube-pune/MarathiNLP公开提供。

关键词

引用

@article{arxiv.2404.18216,
  title  = {L3Cube-MahaNews: News-based Short Text and Long Document Classification Datasets in Marathi},
  author = {Saloni Mittal and Vidula Magdum and Omkar Dhekane and Sharayu Hiwarkhedkar and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2404.18216},
  year   = {2024}
}

备注

Accepted at SPELLL 2023