M^3T:野外多模态连续效价-唤醒度估计
计算机视觉与模式识别
2020-02-10 v1 声音
音频与语音处理
图像与视频处理
摘要
本报告描述了支撑我们提交给 Affective Behavior Analysis in-the-wild (ABAW) 挑战赛效价-唤醒度估计赛道的多模态多任务(M^3T)方法,该挑战赛与 IEEE 自动人脸与手势识别国际会议(FG)2020 联合举办。在所提出的 M^3T 框架中,我们融合来自视频的视觉特征与来自音轨的声学特征以估计效价与唤醒度。时空视觉特征由 3D 卷积网络与双向循环神经网络提取。考虑到效价/唤醒度、情绪与面部动作之间的相关性,我们还探索了从其他任务获益的机制。我们在 ABAW 提供的验证集上评估了 M^3T 框架,其显著优于基线方法。
引用
@article{arxiv.2002.02957,
title = {$M^3$T: Multi-Modal Continuous Valence-Arousal Estimation in the Wild},
author = {Yuan-Hang Zhang and Rulin Huang and Jiabei Zeng and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2002.02957},
year = {2020}
}
备注
6 pages, technical report; submission to ABAW Challenge at FG 2020