中文

基于韵律与语义特征及双向 LSTM 和时间分布 CNN 的抑郁症严重程度预测

人机交互 2022-02-28 v1 人工智能 机器学习

摘要

抑郁症在全球范围内日益对个体的身体和心理造成影响。它已成为全球重大公共卫生问题,并引起各领域研究的关注。传统上,抑郁症诊断通过半结构化访谈和补充问卷进行,这使得诊断严重依赖医师经验且易产生偏倚。心理健康监测与基于云的远程诊断可通过自动化抑郁症诊断系统实现。本文中,我们提出一种基于注意力的多模态语音与文本表示用于抑郁症预测。我们的模型使用 Distress Analysis Interview Corpus-Wizard of Oz (DAIC-WOZ) 数据集训练,以估计参与者的抑郁症严重程度。对于音频模态,我们使用数据集提供的协同语音分析仓库(COVAREP)特征,并采用双向长短期记忆网络(Bi-LSTM)接时间分布卷积神经网络(T-CNN)。对于文本模态,我们使用全局词向量表示(GloVe)进行词嵌入,并将嵌入送入 Bi-LSTM 网络。结果表明,音频与文本模型在抑郁症严重程度估计任务上均表现良好,音频模型在五类(健康、轻度、中度、中重度、重度)上序列级 F1 分数最优为 0.9870、患者级 F1 分数为 0.9074,文本模型在五类上序列级 F1 分数为 0.9709、患者级 F1 分数为 0.9245。多模态融合模型结果相近,在五类患者级抑郁症检测任务上最高 F1 分数为 0.9580。实验显示相较以往工作有统计显著的提升。

关键词

引用

@article{arxiv.2202.12456,
  title  = {Prediction of Depression Severity Based on the Prosodic and Semantic Features with Bidirectional LSTM and Time Distributed CNN},
  author = {Kaining Mao and Wei Zhang and Deborah Baofeng Wang and Ang Li and Rongqi Jiao and Yanhui Zhu and Bin Wu and Tiansheng Zheng and Lei Qian and Wei Lyu and Minjie Ye and Jie Chen},
  journal= {arXiv preprint arXiv:2202.12456},
  year   = {2022}
}

备注

15 pages, 7 figures, already accepted by IEEE Transactions on Affective Computing, listed in early access now