中文

L3Cube-IndicNews:印度语系语言中基于新闻的短文本与长文档分类数据集

计算与语言 2024-04-30 v2 机器学习

摘要

在这项工作中,我们介绍了 L3Cube-IndicNews,一个多语文本分类语料库,旨在为印度区域语言策划高质量数据集,特别关注新闻标题和文章。我们的工作以 10 种主要的印度语系语言为中心,包括印地语、孟加拉语、马拉地语、泰卢固语、泰米尔语、古吉拉特语、卡纳达语、奥里亚语、马拉雅拉姆语和旁遮普语。每个新闻数据集包含 10 个或更多类别的新闻文章。L3Cube-IndicNews 提供了 3 个量身定制的独立数据集,以处理不同的文档长度,分别归类为:包含新闻标题和新闻类别的短标题分类(SHC)数据集,包含整篇新闻文章和新闻类别的长文档分类(LDC)数据集,以及包含新闻子文章和新闻类别的长段落分类(LPC)数据集。我们在所有 3 个数据集中保持一致的标签,以便进行深入的基于长度的分析。我们使用 4 种不同的模型评估这些印度语系语言数据集,包括单语 BERT、多语 IndicSBERT 和 IndicBERT。这项研究为扩充可用文本分类数据集池做出了重大贡献,也使得为印度区域语言开发主题分类模型成为可能。由于各语言之间标签的高度重叠,这也作为跨语言分析的绝佳资源。数据集和模型已在 https://github.com/l3cube-pune/indic-nlp 公开发布

关键词

引用

@article{arxiv.2401.02254,
  title  = {L3Cube-IndicNews: News-based Short Text and Long Document Classification Datasets in Indic Languages},
  author = {Aishwarya Mirashi and Srushti Sonavane and Purva Lingayat and Tejas Padhiyar and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2401.02254},
  year   = {2024}
}

备注

Accepted at the International Conference on Natural Language Processing (ICON 2023)