中文

用于多模态情感分析的基于视频的跨模态辅助网络

计算机视觉与模式识别 2022-08-31 v1 声音 音频与语音处理

摘要

多模态情感分析因多模态交互中的信息互补性而具有广泛应用。以往工作更多关注高效联合表示的探究,却很少考虑单模态特征提取不足与多模态融合的数据冗余。本文提出一种基于视频的跨模态辅助网络(VCAN),其由音频特征映射模块与跨模态选择模块组成。第一模块旨在大幅增加音频特征提取中的特征多样性,通过提供更全面的声学表示以提高分类精度。为使模型能处理冗余视觉特征,第二模块用于在视听数据整合时高效过滤冗余视觉帧。此外,引入由若干图像分类网络构成的分类器组来预测情感极性与情绪类别。在RAVDESS、CMU-MOSI和CMU-MOSEI基准上的大量实验结果表明,VCAN在提升多模态情感分析分类精度方面显著优于SOTA方法。

关键词

引用

@article{arxiv.2208.13954,
  title  = {Video-based Cross-modal Auxiliary Network for Multimodal Sentiment Analysis},
  author = {Rongfei Chen and Wenju Zhou and Yang Li and Huiyu Zhou},
  journal= {arXiv preprint arXiv:2208.13954},
  year   = {2022}
}