深度学习模型在马拉地语文本分类上的实验评估
计算与语言
2022-01-12 v2 机器学习
摘要
马拉地语是印度使用的主要语言之一,主要由马哈拉施特拉邦人民使用。在过去十年中,在线平台上该语言的使用量急剧增加。然而,针对马拉地语文本的自然语言处理(NLP)方法研究并未受到太多关注。马拉地语是一种形态丰富的语言,其书写形式使用天城文的一种变体。本文旨在全面概述可用于马拉地语文本分类的资源和模型。我们在两个公开可用的马拉地语文本分类数据集上评估了基于 CNN、LSTM、ULMFiT 和 BERT 的模型,并给出了对比分析。Facebook 和 IndicNLP 提供的预训练马拉地语 fast text 词嵌入与基于词的模型结合使用。我们表明,在可用数据集上,基于 CNN 和 LSTM 并结合 FastText 嵌入的基础单层模型表现与基于 BERT 的模型相当。我们希望我们的论文有助于马拉地语 NLP 领域的针对性研究与实验。
引用
@article{arxiv.2101.04899,
title = {Experimental Evaluation of Deep Learning models for Marathi Text Classification},
author = {Atharva Kulkarni and Meet Mandhane and Manali Likhitkar and Gayatri Kshirsagar and Jayashree Jagdale and Raviraj Joshi},
journal= {arXiv preprint arXiv:2101.04899},
year = {2022}
}
备注
Accepted at ICMISC 2021