中文

基于时序建模的交互式多模态融合

计算机视觉与模式识别 2025-03-14 v1

摘要

本文提出了用于估计情感基数(valence-arousal,VA)的方法,这一方法用于 8 届情感行为分析在野外(ABAW)竞赛。我们的方案通过多模态框架整合视觉和音频信息。视觉分支使用预训练的 ResNet 模型从面部图像中提取空间特征。音频分支采用预训练的 VGG 模型从语音信号中提取 VGGish 和 LogMel 特征。这些特征通过时序卷积网络(TCN)进行时序建模。随后应用跨模态注意力机制,其中视觉特征通过查询-键-值注意力结构与音频特征相互作用。最后,将特征拼接并通过回归层预测情绪的 valence 和 arousal。我们的方法在 Aff-Wild2 数据集上取得了具竞争力的性能,展示了在野外环境下有效的 VA 估计的多模态融合能力。

关键词

引用

@article{arxiv.2503.10523,
  title  = {Interactive Multimodal Fusion with Temporal Modeling},
  author = {Jun Yu and Yongqi Wang and Lei Wang and Yang Zheng and Shengfan Xu},
  journal= {arXiv preprint arXiv:2503.10523},
  year   = {2025}
}