中文

面向缺失模态情境的跨域抑郁识别稳定性研究

计算机视觉与模式识别 2025-12-09 v1

摘要

抑郁构成严重的公共卫生风险,包括自杀,凸显了及时且可扩展筛查的紧迫性。多模态自动抑郁检测 (ADD) 提供了有前景的解决方案;然而,广泛研究的音频和视频基于 ADD 方法缺乏统一、可泛化的框架,用于处理多样化的抑郁识别场景,并在缺失模态情况下表现有限,这在实际场景中很常见。本文提出了一种统一框架,用于基于多模态大语言模型 (MLLM) 的稳定跨域抑郁识别 (SCD-MLLM)。该框架支持来自不同来源收集的异构抑郁相关数据的集成和处理,同时在输入模态不完整时保持稳定性。具体而言,SCD-MLLM 引入两个关键组件:(i) 多源数据输入适配器 (MDIA),采用掩码机制和任务特定提示将异构抑郁相关输入转换为统一的 token 序列,解决了不同数据来源之间的不一致性;(ii) 模态感知自适应融合模块 (MAFM),通过共享投影机制自适应集成音频和视觉特征,增强了在缺失模态情况下的鲁棒性。我们在来自多场景的五个公开且异构抑郁数据集上进行了全面实验:CMDC、AVEC2014、DAIC-WOZ、DVlog 和 EATD。在完整和部分模态设置下,SCD-MLLM 超过了最先进 (SOTA) 模型以及主要商业 LLM (Gemini 和 GPT),在跨域泛化、捕捉抑郁多模态线索能力以及实际应用中对缺失模态的稳定性方面表现优异。

关键词

引用

@article{arxiv.2512.06447,
  title  = {Towards Stable Cross-Domain Depression Recognition under Missing Modalities},
  author = {Jiuyi Chen and Mingkui Tan and Haifeng Lu and Qiuna Xu and Zhihua Wang and Runhao Zeng and Xiping Hu},
  journal= {arXiv preprint arXiv:2512.06447},
  year   = {2025}
}