中文

L3Cube-MahaSent-MD:一个多领域马拉地语情感分析数据集与Transformer模型

计算与语言 2023-06-27 v1 机器学习

摘要

由于合适数据集的可用性有限,对低资源语言(如马拉地语)中情感分析的探索一直受到制约。在这项工作中,我们提出了L3Cube-MahaSent-MD,一个多领域马拉地语情感分析数据集,包含四个不同领域——电影评论、通用推文、电视节目字幕和政治推文。该数据集由约60,000条人工标注样本组成,涵盖3种不同情感——正面、负面和中性。我们为每个领域创建一个包含15k样本的子数据集。MahaSent-MD是印度语系情感分析领域中首个综合性的多领域情感分析数据集。我们在这些数据集上微调了不同的单语和多语BERT模型,并报告了MahaBERT模型的最佳准确率。我们还给出了广泛的领域内和跨领域分析,从而凸显了对低资源多领域数据集的需求。数据和模型可在 https://github.com/l3cube-pune/MarathiNLP 获取。

关键词

引用

@article{arxiv.2306.13888,
  title  = {L3Cube-MahaSent-MD: A Multi-domain Marathi Sentiment Analysis Dataset and Transformer Models},
  author = {Aabha Pingle and Aditya Vyawahare and Isha Joshi and Rahul Tangsali and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2306.13888},
  year   = {2023}
}

备注

Accepted at DMLR Workshop @ ICML 2023