用于模因情感检测的情感感知多模态融合
计算机与社会
2024-03-18 v1
摘要
不断演变的社交媒体话语中出现了大量使用模因来表达观点或异议的现象。除了被滥用于传播不良内容外,企业和政党还通过挖掘模因来收集公众意见。因此,模因主要提供了情感丰富的见解,有助于确定社会心理。然而,当前的方法尚未能有效建模模因中表达的情感维度。它们严重依赖大型多模态数据集进行预训练,并且由于受限的视觉-语言基础而泛化能力不佳。在本文中,我们引入了 MOOD(Meme emOtiOns Dataset),其中包含六种基本情感。然后,我们提出了 ALFRED(emotion-Aware muLtimodal Fusion foR Emotion Detection),这是一个新颖的多模态神经框架,它 (i) 显式地建模了情感丰富的视觉线索,并且 (ii) 通过门控机制采用了高效的跨模态融合。我们的研究确立了 ALFRED 相对于现有基线的优越性,F1 提高了 4.94%。此外,ALFRED 在具有挑战性的 Memotion 任务上与以往最佳方法竞争激烈。随后,我们通过展示 ALFRED 在两个最新发布的数据集——HarMeme 和 Dank Memes 上相对于其他基线的优势,讨论了其领域无关的泛化能力。此外,我们使用注意力图分析了 ALFRED 的可解释性。最后,我们强调了模因分析中由不同模态特定线索的复杂相互作用所带来的固有挑战。
引用
@article{arxiv.2403.10279,
title = {Emotion-Aware Multimodal Fusion for Meme Emotion Detection},
author = {Shivam Sharma and Ramaneswaran S and Md. Shad Akhtar and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2403.10279},
year = {2024}
}
备注
Accepted to IEEE Transactions on Affective Computing