基于组合潜在特征增强对抗网络的野外时空面部情感估计
计算机视觉与模式识别
2021-02-19 v1 人机交互
摘要
由于情感计算在众多领域的广泛应用,近来引起了研究界的关注。在此背景下,基于视频数据的出现使得在广泛使用的空间特征中融入时间信息得以丰富。然而,此类时空建模常导致极高维的特征空间与海量数据,使训练困难且耗时。本文通过提出一种新颖模型来解决这些不足,该模型借助基于潜在特征的增强时间建模高效提取数据的空间与时间特征。我们提出的模型由三个主要网络构成,称为生成器、判别器与组合器,它们在对抗设定下结合课程学习进行训练,以启用我们的自适应注意力模块。在实验中,我们通过在 AFEW-VA 与 SEWA 数据集上报告具有竞争力的结果展示了方法的有效性,表明时间建模在定性与定量上均改善了情感估计。此外,我们发现注意力机制的引入带来了最高的精度提升,因为其权重似乎与面部运动的外观在时间定位与强度上均良好相关。最后,我们观察到约 160 ms 的序列长度为时间建模的最优长度,这与利用相似长度的其他相关发现一致。
引用
@article{arxiv.2102.09150,
title = {An Enhanced Adversarial Network with Combined Latent Features for Spatio-Temporal Facial Affect Estimation in the Wild},
author = {Decky Aspandi and Federico Sukno and Björn Schuller and Xavier Binefa},
journal= {arXiv preprint arXiv:2102.09150},
year = {2021}
}
备注
Accepted Version on VISAPP 2021