中文

VyAnG-Net:一种通过揭示视觉、声学与词汇特征的多模态讽刺识别新模型

计算机视觉与模式识别 2024-08-21 v1 人工智能 计算与语言 音频与语音处理

摘要

各种语言和非语言线索,如对某个词的过度强调、语调的转变或尴尬的表情,经常传达讽刺意味。对话中的计算机视觉讽刺识别问题旨在识别日常对话中隐藏的讽刺、批评和隐喻信息。此前,讽刺识别主要聚焦于文本。然而,要实现可靠的讽刺识别,必须考虑所有文本信息、音频流、面部表情和身体姿态。因此,我们提出了一种新颖的方法,将一个轻量级深度注意力模块与一个自调节卷积神经网络相结合,以聚焦视觉数据中最关键的特征,并采用基于注意力分词器的策略从文本数据中提取最关键的上下文特定信息。以下是我们的实验在执行多模态讽刺识别任务中所做出的关键贡献:一个注意力分词器分支,用于从字幕提供的词汇内容中获取有益特征;一个视觉分支,用于从视频帧中获取最显著的特征;一个从声学内容中进行语句级特征提取;以及一个基于多头注意力的特征融合分支,用于融合来自多个模态的特征。在其中一个基准视频数据集MUSTaRD上的广泛测试,在说话者相关配置下获得了79.86%的准确率,在说话者无关配置下获得了76.94%的准确率,表明我们的方法优于现有方法。我们还进行了跨数据集分析,以测试VyAnG-Net在另一个数据集MUStARD++的未见样本上的适应性。

关键词

引用

@article{arxiv.2408.10246,
  title  = {VyAnG-Net: A Novel Multi-Modal Sarcasm Recognition Model by Uncovering Visual, Acoustic and Glossary Features},
  author = {Ananya Pandey and Dinesh Kumar Vishwakarma},
  journal= {arXiv preprint arXiv:2408.10246},
  year   = {2024}
}