面向效价-唤醒度估计的时空序列与关系学习多模态融合方法
计算机视觉与模式识别
2024-03-21 v2 声音
音频与语音处理
摘要
本文介绍了我们在ABAW6竞赛中用于VA(效价-唤醒度)估计任务的方法。我们设计了一个综合模型,通过对视频帧和音频片段进行预处理来提取视觉和音频特征。通过利用时序卷积网络(Temporal Convolutional Network, TCN)模块,我们有效捕捉了这些特征之间的时间和空间相关性。随后,我们采用Transformer编码器结构来学习长距离依赖关系,从而增强了模型的性能和泛化能力。我们的方法利用多模态数据融合方法,集成预训练的音频和视频骨干网络进行特征提取,然后进行基于TCN的时空编码和基于Transformer的时序信息捕获。实验结果证明了我们方法的有效性,在AffWild2数据集上的VA估计中取得了有竞争力的性能。
引用
@article{arxiv.2403.12425,
title = {Multimodal Fusion Method with Spatiotemporal Sequences and Relationship Learning for Valence-Arousal Estimation},
author = {Jun Yu and Gongpeng Zhao and Yongqi Wang and Zhihong Wei and Yang Zheng and Zerui Zhang and Zhongpeng Cai and Guochen Xie and Jichao Zhu and Wangyuan Zhu},
journal= {arXiv preprint arXiv:2403.12425},
year = {2024}
}
备注
8 pages,3 figures