中文

融合整体与局部信息估计情绪反应强度

计算机视觉与模式识别 2023-05-10 v1 机器学习

摘要

基于视频的情绪反应强度(ERI)估计从受试者观看刺激物时的视频中,沿若干情绪维度测量受试者对刺激物反应的强度。我们提出一种结合视频与音频信息的基于视频的 ERI 多模态架构。视频输入首先在空间上逐帧编码,融合编码受试者面部表情整体方面的特征与编码其表情空间局部方面的特征。随后跨时间整合输入:逐帧使用门控循环单元(GRUs),然后由 transformer 全局整合。我们以回归 token 处理可变视频长度,将来自所有帧的信息累积为与视频长度无关的定维向量。音频信息类似处理:每帧内提取的频谱信息由级联 GRUs 与带回归 token 的 transformer 跨时间整合。视频与音频回归 token 的输出经拼接合并,再输入最终全连接层产生强度估计。我们的架构在第五届自然场景情感行为分析竞赛(ABAW5)的 ERI 估计挑战赛 Hume-Reaction 数据集上取得优异性能。估计值与受试者自评得分间的皮尔逊相关系数在所有情绪上平均,验证集为 0.455,测试集为 0.4547,远高于基线。transformer 的自注意力机制使我们的架构能聚焦于最关键视频帧而无关长度。消融实验确立了结合整体/局部特征与多模态整合的优势。代码见 https://github.com/HKUST-NISL/ABAW5。

关键词

引用

@article{arxiv.2305.05534,
  title  = {Integrating Holistic and Local Information to Estimate Emotional Reaction Intensity},
  author = {Yini Fang and Liang Wu and Frederic Jumelle and Bertram Shi},
  journal= {arXiv preprint arXiv:2305.05534},
  year   = {2023}
}

备注

This paper will be published in CVPRW 2023