通过视觉-音频内容的文本情感描述丰富多模态情感分析
计算机视觉与模式识别
2024-12-17 v1 人工智能
声音
音频与语音处理
摘要
多模态情感分析(MSA)是关键研究前沿,旨在综合性解构人类情感,融合文本、音频和视觉数据。然而,分辨音频和视频表达中细微的情感细微差异面临巨大挑战,尤其当情感极性在不同片段间相似时。本文旨在凸显音频和视觉模态中与情感相关的属性,以促进视觉-音频情境下的多模态融合。为此,我们引入了 DEVA—a 一个基于文本情感描述的渐进式融合框架,旨在突出视觉-音频内容的情感特征。DEVA 采用情感描述生成器(EDG)将原始音频和视觉数据转化为文本化的情感描述,从而放大其情感特征。这些描述随后与源数据相融合,生成更丰富、更强化的特征。此外,DEVA 融入文本引导的渐进式融合模块(TPF),利用不同层次的文本作为核心模态指导。该模块逐步融合视觉-音频次模态,以缓解文本与视觉-音频模态之间的差异。在广泛使用的情感分析基准数据集(包括 MOSI、MOSEI 和 CH-SIMS)上的实验结果表明,DEVA 相较于最新模型实现了显著提升。此外,细粒度情感实验也证明了 DEVA 对细微情感变化的稳健敏感性。
引用
@article{arxiv.2412.10460,
title = {Enriching Multimodal Sentiment Analysis through Textual Emotional Descriptions of Visual-Audio Content},
author = {Sheng Wu and Xiaobao Wang and Longbiao Wang and Dongxiao He and Jianwu Dang},
journal= {arXiv preprint arXiv:2412.10460},
year = {2024}
}