L3CubeMahaSent:一个基于马拉地语推文的情感分析数据集
计算与语言
2021-06-29 v2 机器学习
摘要
情感分析是自然语言处理中最基础的任务之一。英语、阿拉伯语、俄语、普通话等流行语言,以及印地语、孟加拉语、泰米尔语等印度语言在该领域已见大量工作。然而,作为印度第三大流行语言的马拉地语因缺乏合适数据集而仍然落后。本文提出首个主要的公开可用马拉地语情感分析数据集——L3CubeMahaSent。它使用从多位马哈拉施特拉邦名人 Twitter 账户提取的推文整理而成。我们的数据集包含约 16,000 条不同推文,分为积极、消极与中性三个大类。我们还给出了用于标注推文的指南。最后,我们展示了数据集的统计数据以及使用 CNN、LSTM、ULMFiT 和基于 BERT 的深度学习模型的基线分类结果。
引用
@article{arxiv.2103.11408,
title = {L3CubeMahaSent: A Marathi Tweet-based Sentiment Analysis Dataset},
author = {Atharva Kulkarni and Meet Mandhane and Manali Likhitkar and Gayatri Kshirsagar and Raviraj Joshi},
journal= {arXiv preprint arXiv:2103.11408},
year = {2021}
}
备注
Accepted at WASSA@EACL 2021