用于自然场景下情感识别的联合多模态 Transformer
计算机视觉与模式识别
2024-04-23 v3 机器学习
声音
音频与语音处理
摘要
多模态情感识别(MMER)系统通常通过利用例如视觉、文本、生理和听觉等模态之间的模态间和模态内关系,来优于单模态系统。本文提出了一种 MMER 方法,该方法依赖于带有基于键的交叉注意力的联合多模态 Transformer(JMT)进行融合。该框架可以利用不同模态的互补特性来提高预测精度。独立的骨干网络捕获视频序列中每个模态内的模态内时空依赖关系。随后,我们的 JMT 融合架构整合了各个模态的嵌入,使模型能够有效地捕获模态间和模态内关系。在两个具有挑战性的表情识别任务上进行了大量实验——(1) 在 Affwild2 数据集上的维度情感识别(包含人脸和声音)和 (2) 在 Biovid 数据集上的疼痛估计(包含人脸和生物传感器)——表明我们的 JMT 融合可以为 MMER 提供一种高性价比的解决方案。实证结果表明,采用我们提出的融合方法的 MMER 系统使我们能够优于相关的基线方法和 SOTA 方法。
引用
@article{arxiv.2403.10488,
title = {Joint Multimodal Transformer for Emotion Recognition in the Wild},
author = {Paul Waligora and Haseeb Aslam and Osama Zeeshan and Soufiane Belharbi and Alessandro Lameiras Koerich and Marco Pedersoli and Simon Bacon and Eric Granger},
journal= {arXiv preprint arXiv:2403.10488},
year = {2024}
}
备注
10 pages, 4 figures, 6 tables, CVPRw 2024