TopicDiff:一种用于多模态对话情感检测的主题增强扩散方法
计算与语言
2024-03-12 v2 人工智能
机器学习
摘要
多模态对话情感(MCE)检测通常跨越声学、视觉和语言模态,在多媒体领域引起了越来越多的兴趣。以往的研究主要集中在学习对话中的上下文信息,仅有少数考虑了单一语言模态中的主题信息,同时往往忽略了声学和视觉的主题信息。在此基础上,我们提出了一种与模型无关的主题增强扩散(TopicDiff)方法,用于在 MCE 任务中捕获多模态主题信息。特别是,我们将扩散模型集成到神经主题模型中,以缓解神经主题模型在捕获主题信息时存在的多样性不足问题。详细的评估表明,TopicDiff 相较于最先进的 MCE 基线取得了显著改进,证明了多模态主题信息对 MCE 的重要性以及 TopicDiff 在捕获此类信息方面的有效性。此外,我们观察到一个有趣的发现:与语言相比,声学和视觉中的主题信息更具判别性和鲁棒性。
引用
@article{arxiv.2403.04789,
title = {TopicDiff: A Topic-enriched Diffusion Approach for Multimodal Conversational Emotion Detection},
author = {Jiamin Luo and Jingjing Wang and Guodong Zhou},
journal= {arXiv preprint arXiv:2403.04789},
year = {2024}
}