中文

M2H2:一个用于对话中幽默识别的多模态多方印地语数据集

计算与语言 2021-08-04 v1

摘要

对话中的幽默识别是一项具有挑战性的任务,因其在对话理解(包括多模态环境,即文本、声学和视觉)中的重要性,近来受到广泛关注。现有的少数幽默数据集大多为英语。然而,由于多语言内容的巨大增长,构建支持多语言信息访问的模型和系统存在巨大需求。为此,我们提出了一个用于对话中多模态多方印地语幽默(M2H2)识别的数据集,包含来自一部非常受欢迎的电视剧《Shrimaan Shrimati Phir Se》13 集的 6,191 条话语。每条话语都标注了幽默/非幽默标签,并包含声学、视觉和文本模态。我们提出了几个强大的多模态基线,并展示了上下文和多模态信息对于对话中幽默识别的重要性。在 M2H2 数据集上的实证结果表明,多模态信息对单模态信息在幽默识别中起到了补充作用。该数据集和基线可在 http://www.iitp.ac.in/~ai-nlp-ml/resources.html 和 https://github.com/declare-lab/M2H2-dataset 获取。

关键词

引用

@article{arxiv.2108.01260,
  title  = {M2H2: A Multimodal Multiparty Hindi Dataset For Humor Recognition in Conversations},
  author = {Dushyant Singh Chauhan and Gopendra Vikram Singh and Navonil Majumder and Amir Zadeh and Asif Ekbal and Pushpak Bhattacharyya and Louis-philippe Morency and Soujanya Poria},
  journal= {arXiv preprint arXiv:2108.01260},
  year   = {2021}
}

备注

ICMI 2021