代码混合对话中的多模态讽刺检测与幽默分类
计算与语言
2021-06-01 v2
摘要
讽刺检测与幽默分类本质上是微妙的问题,主要源于其对语境和非语言信息的依赖。此外,由于缺乏高质量的标注数据集,这两个主题的现有研究通常局限于印地语等非英语语言。针对上述局限,本文做出了两项主要贡献:(1) 我们构建了一个印地英代码混合数据集 MaSaC,用于对话中的多模态讽刺检测与幽默分类,据我们所知这是此类首个数据集;(2) 我们提出了 MSH-COMICS,一种用于话语分类的新型富含注意力的神经架构。我们利用分层注意力机制学习高效的话语表示,该机制每次仅关注输入句子的一小部分。此外,我们引入对话级上下文注意力机制,以利用对话历史进行多模态分类。我们通过改变多模态输入和 MSH-COMICS 的各个子模块,对两项任务进行了大量实验,并与现有方法进行了对比分析。我们观察到,MSH-COMICS 在讽刺检测上以超过 1 个 F1 分数点的优势、在幽默分类上以 10 个 F1 分数点的优势优于现有模型。我们对模型进行诊断,并对结果进行深入分析,以理解其优势与不足。
引用
@article{arxiv.2105.09984,
title = {Multi-modal Sarcasm Detection and Humor Classification in Code-mixed Conversations},
author = {Manjot Bedi and Shivani Kumar and Md Shad Akhtar and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2105.09984},
year = {2021}
}
备注
13 pages, 4 figures, 9 tables