面向低资源语言数据集创建、整理与分类的方法探究:以 Setswana 和 Sepedi 为例
计算与语言
2020-03-12 v1 机器学习
机器学习
摘要
自然语言处理的最新进展为拥有可用整理数据和研究资源的优势语言带来了便利。低资源语言面临的挑战之一在于针对不同的用例,缺乏关于数据集收集、整理和准备的明确指南。在本工作中,我们承担了为 Setswana 和 Sepedi 创建两个聚焦于新闻标题(即短文本)的数据集以及构建新闻主题分类任务的工作。我们记录了工作过程并给出了分类的基线。我们探究了一种更适用于低资源语言的数据增强方法,以提升分类器的性能。
引用
@article{arxiv.2003.04986,
title = {Investigating an approach for low resource language dataset creation, curation and classification: Setswana and Sepedi},
author = {Vukosi Marivate and Tshephisho Sefara and Vongani Chabalala and Keamogetswe Makhaya and Tumisho Mokgonyane and Rethabile Mokoena and Abiodun Modupe},
journal= {arXiv preprint arXiv:2003.04986},
year = {2020}
}
备注
Submitted to Resources for African Indigenous Languages (RAIL) at LREC 2020