中文

基于混合专家模型的抑郁识别:针对访谈与阅读任务

机器学习 2026-05-12 v2 计算机与社会

摘要

抑郁是一种精神疾病,可引发心理、身体和社会等多种症状。语音已被证明是抑郁早期识别的客观标记。为此,众多研究致力于通过语音识别抑郁。然而,现有方法仅使用自发语音,忽略了通过阅读语音获取的信息,或依赖难以获取的手动转录(或来自自动转录的高错误率),且未针对输入条件计算方法进行设计。为解决这些局限性,本文首次在抑郁识别任务中获取自发语音与阅读语音的表征,采用多模态融合方法,并在单一深度神经网络中应用混合专家(Mixture of Experts, MoE)模型。具体而言,我们将两个语音文件分别转换为 log-Mel 梅度谱图、delta 与 delta-delta。随后,这两个任务的图像表征通过共享 AlexNet 模型处理。AlexNet 模型的输出作为输入传递给多模态融合方法。最终向量传递给 MoE 模块。本研究采用三种 MoE 变体:稀疏门控 MoE 与基于因子分解的多线性 MoE。研究结果表明,我们的方法在Androids语料库上实现了87.00%的准确率和86.66%的F1分数。

关键词

引用

@article{arxiv.2502.20213,
  title  = {Mixture of Experts for Recognizing Depression from Interview and Reading Tasks},
  author = {Loukas Ilias and Dimitris Askounis},
  journal= {arXiv preprint arXiv:2502.20213},
  year   = {2026}
}

备注

Accepted at ICASSP 2026