中文

基于时间感知门控融合的多模态情感价值- arousal 估计

多媒体 2025-07-04 v1 声音

摘要

多模态情感识别在价值- arousal 估计中常因音频和视觉模态之间的噪声和错位导致性能下降。为此,我们提出了一种名为 TAGF 的时间感知门控融合框架,用于多模态情感识别。TAGF 根据时间动态自适应调制递归注意力输出的贡献。具体而言,TAGF 采用基于双向 LSTM 的时间门控机制来学习每个递归步骤的相对重要性,并有效整合多步骤的跨模态特征。通过将时间感知嵌入递归融合过程中,TAGF 有效捕获情感表达的序列演变以及模态之间复杂的相互作用。在 Aff-Wild2 数据集上的实验结果表明,TAGF 在与现有基于递归注意力模型相比时达到了具竞争力的性能。此外,TAGF 对跨模态错位具有强大的鲁棒性,并可可靠地在实际条件下建模动态情感转换。

关键词

引用

@article{arxiv.2507.02080,
  title  = {TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation},
  author = {Yubeen Lee and Sangeun Lee and Chaewon Park and Junyeop Cha and Eunil Park},
  journal= {arXiv preprint arXiv:2507.02080},
  year   = {2025}
}

备注

9 pages, 2 figures, 2 tables