基于图表示的两阶段时序建模框架用于视频抑郁识别
计算机视觉与模式识别
2021-12-01 v1
摘要
基于视频的自动抑郁分析提供了一种快速、客观且可重复的自评方案,近年来得到广泛发展。尽管抑郁线索可能由不同时间尺度的人类面部行为反映,现有多数方法要么侧重于从短期要么从视频级面部行为建模抑郁。为此,我们提出一种两阶段框架,从多尺度短期和视频级面部行为建模抑郁严重程度。短期抑郁行为建模阶段首先从多个短时时间尺度深度学习了抑郁相关面部行为特征,其中提出抑郁特征增强(DFE)模块以增强所有时间尺度的抑郁相关线索并去除非抑郁噪声。随后,视频级抑郁行为建模阶段提出两种新颖图编码策略,即序列图表示(SEG)和谱图表示(SPG),将目标视频的所有短期特征重新编码为视频级图表示,总结抑郁相关的多尺度视频级时序信息。由此产生的图表示利用短期和长期面部行为模式预测抑郁严重程度。在 AVEC 2013 和 AVEC 2014 数据集上的实验结果表明,所提 DFE 模块持续增强了各种 CNN 模型的抑郁严重程度估计性能,而 SPG 优于其他视频级建模方法。更重要的是,所提两阶段框架取得的结果显示出相较于广泛使用的单阶段建模方法的优异且稳健性能。
引用
@article{arxiv.2111.15266,
title = {Two-stage Temporal Modelling Framework for Video-based Depression Recognition using Graph Representation},
author = {Jiaqi Xu and Siyang Song and Keerthy Kusumam and Hatice Gunes and Michel Valstar},
journal= {arXiv preprint arXiv:2111.15266},
year = {2021}
}