EmoMix-3L:用于孔加拉-英语-印地语情感检测的代码混合数据集
计算与语言
2024-05-14 v1
摘要
代码混合是一种已被广泛研究的语言现象,发生在文本或语音中混合两种或多种语言。针对代码混合数据,已进行多项研究,包括构建数据集和执行下游 NLP 任务。尽管观察到三种以上语言的代码混合并不罕见,但本领域的大多数现有数据集仅包含两种语言的代码混合数据。本文介绍 EmoMix-3L,一个新型的多标签情感检测数据集,包含来自三种不同语言的代码混合数据。我们在 EmoMix-3L 上实验多个模型,并报告 MuRIL 在该数据集上优于其他模型。
关键词
引用
@article{arxiv.2405.06922,
title = {EmoMix-3L: A Code-Mixed Dataset for Bangla-English-Hindi Emotion Detection},
author = {Nishat Raihan and Dhiman Goswami and Antara Mahmud and Antonios Anastasopoulos and Marcos Zampieri},
journal= {arXiv preprint arXiv:2405.06922},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2310.18387, arXiv:2310.18023