利用 TCN 与 Transformer 实现连续情绪识别中视觉-音频的有效融合
计算机视觉与模式识别
2023-09-07 v3
摘要
人类情绪识别在人机交互中起着重要作用。本文介绍了我们参加第五届自然场景下情感行为分析研讨会与竞赛(ABAW)的效价-唤醒度(VA)估计挑战、表情(Expr)分类挑战和动作单元(AU)检测挑战的方法。具体而言,我们提出了一种新颖的多模态融合模型,利用时序卷积网络(TCN)和 Transformer 来增强连续情绪识别的性能。我们的模型旨在有效整合视觉与音频信息,以提高情绪识别的准确性。我们的模型优于基线,并在表情分类挑战中排名第 3。
引用
@article{arxiv.2303.08356,
title = {Leveraging TCN and Transformer for effective visual-audio fusion in continuous emotion recognition},
author = {Weiwei Zhou and Jiada Lu and Zhaolong Xiong and Weifeng Wang},
journal= {arXiv preprint arXiv:2303.08356},
year = {2023}
}
备注
2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)