用于自然场景下情感识别的多任务学习框架
计算机视觉与模式识别
2022-08-31 v3
摘要
本文介绍了我们在第四届自然场景下情感行为分析(ABAW)竞赛多任务学习(MTL)挑战赛中的系统。我们从三个方面探讨该挑战的研究问题:1)为获取高效且鲁棒的视觉特征表示,我们提出了基于 MAE 的无监督表示学习以及基于 IResNet/DenseNet 的有监督表示学习方法;2)考虑到视频中时序信息的重要性,我们探索了三类时序编码器以捕获时序信息,包括基于 transformer 的编码器、基于 LSTM 的编码器和基于 GRU 的编码器;3)为建模这些不同任务(即效价、唤醒度、表情和 AU)之间的相关性以进行多任务情感分析,我们首先探索这些不同任务间的依赖关系,并提出三种多任务学习框架以有效建模相关性。我们的系统在验证集上取得 的性能,在测试集上取得 的性能,在 MTL 挑战赛中排名第一。代码可在 https://github.com/AIM3-RUC/ABAW4 获取。
引用
@article{arxiv.2207.09373,
title = {Multi-Task Learning Framework for Emotion Recognition in-the-wild},
author = {Tenggan Zhang and Chuanhe Liu and Xiaolong Liu and Yuchen Liu and Liyu Meng and Lei Sun and Wenqiang Jiang and Fengyuan Zhang and Jinming Zhao and Qin Jin},
journal= {arXiv preprint arXiv:2207.09373},
year = {2022}
}