TamilEmo:面向泰米尔语的细粒度情感检测数据集
计算与语言
2022-02-11 v1
摘要
基于文本输入的情感分析一直被视为自然语言处理中既具挑战性又有趣的任务。然而,由于低资源语言(如泰米尔语)缺乏数据集,在该领域开展高标准研究十分困难。因此,我们引入了这个标注数据集(一个包含超过 42k 条泰米尔语 YouTube 评论的最大规模人工标注数据集,标注了包括中性在内的 31 种情感),用于情感识别。该数据集的目标是改进泰米尔语中多个下游任务的情感检测。我们还创建了三种不同的情感分组(3 类、7 类和 31 类),并评估了模型在每个分组类别上的性能。我们的 MURIL-base 模型在 3 类分组数据集上取得了 0.60 的宏平均 F1 分数。在 7 类和 31 类分组中,随机森林模型表现良好,宏平均 F1 分数分别为 0.42 和 0.29。
引用
@article{arxiv.2202.04725,
title = {TamilEmo: Finegrained Emotion Detection Dataset for Tamil},
author = {Charangan Vasantharajan and Sean Benhur and Prasanna Kumar Kumarasen and Rahul Ponnusamy and Sathiyaraj Thangasamy and Ruba Priyadharshini and Thenmozhi Durairaj and Kanchana Sivanraju and Anbukkarasi Sampath and Bharathi Raja Chakravarthi and John Phillip McCrae},
journal= {arXiv preprint arXiv:2202.04725},
year = {2022}
}
备注
11 pages, 4 figures