L3Cube-MahaSent-MD:一个多领域马拉地语情感分析数据集与Transformer模型
计算与语言
2023-06-27 v1 机器学习
摘要
由于合适数据集的可用性有限,对低资源语言(如马拉地语)中情感分析的探索一直受到制约。在这项工作中,我们提出了L3Cube-MahaSent-MD,一个多领域马拉地语情感分析数据集,包含四个不同领域——电影评论、通用推文、电视节目字幕和政治推文。该数据集由约60,000条人工标注样本组成,涵盖3种不同情感——正面、负面和中性。我们为每个领域创建一个包含15k样本的子数据集。MahaSent-MD是印度语系情感分析领域中首个综合性的多领域情感分析数据集。我们在这些数据集上微调了不同的单语和多语BERT模型,并报告了MahaBERT模型的最佳准确率。我们还给出了广泛的领域内和跨领域分析,从而凸显了对低资源多领域数据集的需求。数据和模型可在 https://github.com/l3cube-pune/MarathiNLP 获取。
引用
@article{arxiv.2306.13888,
title = {L3Cube-MahaSent-MD: A Multi-domain Marathi Sentiment Analysis Dataset and Transformer Models},
author = {Aabha Pingle and Aditya Vyawahare and Isha Joshi and Rahul Tangsali and Raviraj Joshi},
journal= {arXiv preprint arXiv:2306.13888},
year = {2023}
}
备注
Accepted at DMLR Workshop @ ICML 2023