基于音视觉领导者-跟随者注意力融合的连续情绪识别
计算机视觉与模式识别
2021-08-18 v3 多媒体
摘要
我们提出一种音视觉时空深度神经网络,包含:(1) 视觉块,由预训练 2D-CNN 后接时序卷积网络(TCN)组成;(2) 听觉块,包含若干并行 TCN;(3) 领导者-跟随者注意力融合块,用于结合音视觉信息。具有大历史覆盖的 TCN 使我们的模型能够利用比基线和最先进方法(即 36 或 48)大得多的窗口长度(即 300)内的时空信息。融合块在强调视觉模态的同时,利用模态间注意力机制来利用含噪的听觉模态。为充分利用数据并缓解过拟合,在训练集和验证集上进行了交叉验证。采用一致性相关系数(CCC)中心化来合并各折结果。在 Aff-Wild2 数据库的测试(验证)集上,所实现的效价 CCC 为 0.463 (0.469),唤醒度 CCC 为 0.492 (0.649),显著优于基线方法对应的效价和唤醒度 CCC 0.200 (0.210) 和 0.190 (0.230)。代码见 https://github.com/sucv/ABAW2。
引用
@article{arxiv.2107.01175,
title = {Continuous Emotion Recognition with Audio-visual Leader-follower Attentive Fusion},
author = {Su Zhang and Yi Ding and Ziquan Wei and Cuntai Guan},
journal= {arXiv preprint arXiv:2107.01175},
year = {2021}
}
备注
8 pages, 2 figures, 2 tables, accepted to the ICCV 2021: 2nd Workshop and Competition on Affective Behavior Analysis in-the-wild (ABAW2)