中文

一种用于真实场景情感分析的多时段多任务分析框架

计算机视觉与模式识别 2020-10-05 v2

摘要

人类情感识别是人机交互中的重要因素。然而,基于真实场景(in-the-wild)数据的方法开发尚不足以达到实际使用的精度。本文介绍了提交至2020年真实场景情感行为分析(ABAW)竞赛的、关注效价-唤醒(VA)与表情(EXP)的情感识别方法。由于我们考虑到情感行为具有许多具有各自时间尺度的可观测特征,我们在分析框架中引入多尺度优化时间窗(短期、中期、长期)以从视频数据提取特征参数。此外,我们使用了多模态数据,包括动作单元、头部姿态、视线、姿势以及ResNet 50或Efficient NET特征,并在特征提取过程中予以优化。随后,我们为每个时间窗生成情感识别模型并将这些模型集成。同时,我们将效价、唤醒与表情模型融合以实现多任务学习,考虑到面部表情背后的基础心理状态彼此密切相关。在验证集上,我们的模型取得了0.498的效价-唤醒分数与0.471的面部表情分数。这些验证结果表明我们提出的框架能有效提升估计精度与鲁棒性。

关键词

引用

@article{arxiv.2009.13885,
  title  = {A Multi-term and Multi-task Analyzing Framework for Affective Analysis in-the-wild},
  author = {Sachihiro Youoku and Yuushi Toyoda and Takahisa Yamamoto and Junya Saito and Ryosuke Kawamura and Xiaoyu Mi and Kentaro Murase},
  journal= {arXiv preprint arXiv:2009.13885},
  year   = {2020}
}

备注

5 pages with 6 figures