MF-GCN:基于眼动、面部和声学特征的三模态抑郁检测的多频图卷积网络
计算机视觉与模式识别
2025-11-24 v2 人工智能
摘要
抑郁是一种全球流行的精神健康疾病,特征为持续的低情绪和情感缺失。然而,它仍未被诊断,因为现有诊断方法高度依赖主观临床评估。为实现客观检测,我们引入了一个包含103名临床评估者的黄金标准数据集,通过三模态数据方法独特地集成了眼动数据与音频和视频数据,以提供抑郁症状的全面表征。眼动数据量化了抑郁群体常见的对负面刺激的注意力偏差。音频和视频数据捕捉抑郁症特有的情感平淡和精神运动减退。统计验证确认其在区分抑郁和非抑郁群体方面的显著辨别能力。我们解决了现有图基模型仅关注低频信息的关键局限性,提出了多频图卷积网络(MF-GCN)。该框架由一种新颖的多频滤波器组模块(MFFBM)组成,能够利用低频和高频信号。广泛的评估表明,MF-GCN consistently优于传统机器学习算法和深度学习框架。在二分类任务中,模型实现了0.96的灵敏度和0.94的F2分数。对于三分类任务,所提出的方法实现了0.79的灵敏度和0.87的特异度,并显著优于其他模型。为验证模型的通用性,该模型还在中国多模态抑郁语料库(CMDC)数据集上进行了评估,实现了0.95的灵敏度和0.96的F2分数。这些结果确认了该三模态、多频框架有效地捕捉了跨模态相互作用,以实现准确的抑郁检测。
引用
@article{arxiv.2511.15675,
title = {MF-GCN: A Multi-Frequency Graph Convolutional Network for Tri-Modal Depression Detection Using Eye-Tracking, Facial, and Acoustic Features},
author = {Sejuti Rahman and Swakshar Deb and MD. Sameer Iqbal Chowdhury and MD. Jubair Ahmed Sourov and Mohammad Shamsuddin},
journal= {arXiv preprint arXiv:2511.15675},
year = {2025}
}