中文

低资源语言数据集创建、整理与分类:茨瓦纳语和塞佩迪语——扩展摘要

计算与语言 2020-04-30 v1

摘要

自然语言处理的最新进展仅对代表性良好的语言有益,忽视了对鲜为人知的全球语言的研究。这部分归因于经过整理的数据和研究资源的可用性。当前低资源语言面临的挑战之一是关于针对不同用例的数据集收集、整理和准备的明确指南。在这项工作中,我们承担了为茨瓦纳语和塞佩迪语创建两个聚焦于新闻标题(即短文本)的数据集,并基于这些数据集创建新闻主题分类任务的任务。在本研究中,我们记录了我们的工作,提出了分类基线,并研究了一种更适用于低资源语言的数据增强方法,以提高分类器的性能。

关键词

引用

@article{arxiv.2004.13842,
  title  = {Low resource language dataset creation, curation and classification: Setswana and Sepedi -- Extended Abstract},
  author = {Vukosi Marivate and Tshephisho Sefara and Vongani Chabalala and Keamogetswe Makhaya and Tumisho Mokgonyane and Rethabile Mokoena and Abiodun Modupe},
  journal= {arXiv preprint arXiv:2004.13842},
  year   = {2020}
}

备注

Accepted for the AfricaNLP workshop at ICLR 2020