中文

预训练模型为何失败:多模态抑郁检测中的特征纠缠

音频与语音处理 2025-03-11 v1

摘要

抑郁症仍然是一个紧迫的全球心理健康问题,推动了大量针对 AI 驱动检测方法的研究。尽管预训练模型,特别是语音自监督模型(SSL 模型),已被应用于抑郁检测,但在没有大量数据增强的情况下,它们表现出出乎意料的糟糕性能。大型语言模型(LLM)尽管在各个领域取得了成功,但尚未在多模态抑郁检测中得到探索。在本文中,我们首先建立了一个基于 LLM 的系统以探究其在此任务中的潜力,揭示了其在处理多模态信息方面的根本局限性。通过系统分析,我们发现预训练模型性能不佳源于高层信息的混淆,即从内容和语音中提取的高层特征在预训练模型的表示中混合在一起,使得难以建立有效的决策边界。为了解决这个问题,我们提出了一个信息分离框架来解耦这些特征,显著提升了 SSL 模型和 LLM 在抑郁检测中的性能。我们的实验验证了这一发现,并表明分离特征的集成比现有方法取得了显著改进,为开发更有效的多模态抑郁检测系统提供了新见解。

关键词

引用

@article{arxiv.2503.06620,
  title  = {Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection},
  author = {Xiangyu Zhang and Beena Ahmed and Julien Epps},
  journal= {arXiv preprint arXiv:2503.06620},
  year   = {2025}
}