解读帧间信息:基于非语言线索的视频多模态抑郁检测
计算机视觉与模式识别
2024-01-08 v1
摘要
抑郁症是全球残疾的主要原因之一,影响着相当一部分人口。从社交媒体文本中检测抑郁症的研究已十分普遍,但仅有少数工作探索了从用户生成视频内容中检测抑郁症。在本工作中,我们通过提出一种简单灵活的多模态时序模型来填补这一研究空白,该模型能够从嘈杂的真实世界视频中的多种模态识别非语言抑郁线索。我们表明,对于野外视频,使用额外的高级非语言线索对于实现良好性能至关重要;我们提取并处理了音频语音嵌入、面部情绪嵌入、面部、身体和手部地标,以及注视和眨眼信息。通过大量实验,我们表明我们的模型在三个关键的抑郁症视频检测基准数据集上以显著优势达到了最先进 (SOTA) 的结果。我们的代码已在 GitHub 上公开。
引用
@article{arxiv.2401.02746,
title = {Reading Between the Frames: Multi-Modal Depression Detection in Videos from Non-Verbal Cues},
author = {David Gimeno-Gómez and Ana-Maria Bucur and Adrian Cosma and Carlos-David Martínez-Hinarejos and Paolo Rosso},
journal= {arXiv preprint arXiv:2401.02746},
year = {2024}
}
备注
Accepted at 46th European Conference on Information Retrieval (ECIR 2024)