用于讽刺中情绪识别的多模态语料库
计算与语言
2022-06-07 v1
摘要
尽管情感与情绪分析已被广泛研究,讽刺与情绪之间的关系在很大程度上仍未被探索。一个讽刺性表达可能蕴含多种潜在情绪。例如,“我喜欢被忽视”暗含悲伤,而“我的手机棒极了,续航只有 15 分钟!”表达沮丧。检测讽刺表达背后的情绪虽非易事却是一项重要任务。我们着手进行讽刺语句中的情绪检测任务,据我们所知,这在此前尚未被探索。我们从最近发布的多模态讽刺检测数据集(MUStARD)出发,该数据集预先标注了 9 种情绪。我们识别并修正了 343 个错误情绪标签(共 690 个)。我们将数据集规模翻倍,标注情绪以及效价(valence)与唤醒度(arousal),二者均为情绪强度的重要指标。最后,我们将每个讽刺话语标注为四类讽刺之一——命题型、嵌入型、Like 前缀型与言外型,以推动讽刺检测研究。基于多模态(文本、音频与视频)融合模型的详尽实验确立了讽刺中精确情绪识别的基准,并优于最先进的讽刺检测。我们发布该富含多种标注的数据集及代码以供研究:https://github.com/apoorva-nunna/MUStARD_Plus_Plus
引用
@article{arxiv.2206.02119,
title = {A Multimodal Corpus for Emotion Recognition in Sarcasm},
author = {Anupama Ray and Shubham Mishra and Apoorva Nunna and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2206.02119},
year = {2022}
}