基于循环与注意力的连续时间音视频融合用于真实场景情感识别
声音
2022-03-30 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
本文介绍了我们向第三届真实场景情感行为分析(ABAW)挑战赛提交的工作。学习多模态序列间复杂的交互对于从真实场景音视频数据中识别维度情感至关重要。循环与注意力是文献中两种广泛使用的序列建模机制。为清晰理解循环模型与注意力模型在音视频情感识别中的性能差异,我们基于 LSTM-RNNs、自注意力与跨模态注意力,对为效价与唤醒度估计而训练的融合模型进行了全面评估。特别地,我们研究了若干关键设计选择的影响:为时序模型提供特征的 CNN 骨干的建模复杂度,以及是否采用端到端学习。我们在真实场景 ABAW 语料库上通过系统调节网络架构设计与训练优化中涉及的超参数来训练音视频情感识别模型。我们对音视频融合模型的广泛评估表明,当与低复杂度 CNN 骨干结合并以端到端方式训练时,LSTM-RNNs 可优于注意力模型,这意味着注意力模型未必是连续时间多模态情感识别的最优选择。
引用
@article{arxiv.2203.13285,
title = {Continuous-Time Audiovisual Fusion with Recurrence vs. Attention for In-The-Wild Affect Recognition},
author = {Vincent Karas and Mani Kumar Tellamekala and Adria Mallol-Ragolta and Michel Valstar and Björn W. Schuller},
journal= {arXiv preprint arXiv:2203.13285},
year = {2022}
}
备注
10 pages, 1 figures, added references and an overview figure