MMFformer:用于抑郁检测的多模态融合变换网络
计算机视觉与模式识别
2025-08-12 v1 人工智能
计算与语言
机器学习
声音
音频与语音处理
摘要
抑郁是一种严重的精神疾病,对个体的福祉和生活质量产生显著影响,因此早期检测对于提供 adequate care and treatment至关重要。抑郁诊断通常困难,因为其主要基于临床访谈中的主观评估。因此,得益于社交网络内容,抑郁的早期诊断已成为重要的研究领域。用户生成信息的广泛且多样化特性构成了显著挑战,限制了准确提取相关时序信息以及有效地跨模态融合数据的能力。本文介绍MMFformer,一种用于从多模态社交媒体信息中检索抑郁时空高级模式的多模态抑郁检测网络。具有残差连接的变换网络捕获视频的空间特征,利用变换编码器设计音频中重要的时序动态。此外,融合架构通过晚期和中间融合策略融合提取的特征,以发现其中最相关的跨模态关联。最后,在两个大型抑郁检测数据集上评估了该网络,结果清晰地表明它超越了现有的方法,分别在D-Vlog数据集和LMVD数据集上提高了13.92%和7.74%的F1-评分。该代码已公开提供,地址为https://github.com/rezwanh001/Large-Scale-Multimodal-Depression-Detection。
引用
@article{arxiv.2508.06701,
title = {MMFformer: Multimodal Fusion Transformer Network for Depression Detection},
author = {Md Rezwanul Haque and Md. Milon Islam and S M Taslim Uddin Raju and Hamdi Altaheri and Lobna Nassar and Fakhri Karray},
journal= {arXiv preprint arXiv:2508.06701},
year = {2025}
}
备注
Accepted for the 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Vienna, Austria