中文

利用发音协调特征与基于层次注意力的文本嵌入的多模态抑郁分类

音频与语音处理 2022-02-15 v1 计算与语言

摘要

多模态抑郁分类近年来受到极大关注。我们开发了一种多模态抑郁分类系统,利用从声道变量提取的发音协调特征,以及由自动语音识别工具得到的文本转写,相较于单模态分类器(音频与文本分别提升 7.5% 和 13.7% 的受试者工作特征曲线下面积)取得了改进。我们表明,在训练数据有限的情况下,可先训练段级分类器,再通过多阶段卷积循环神经网络获得会话级预测而不损害性能。文本模型使用层次注意力网络(HAN)训练。多模态系统通过将会话级音频模型的嵌入与 HAN 文本模型的嵌入相结合来构建。

关键词

引用

@article{arxiv.2202.06238,
  title  = {Multimodal Depression Classification Using Articulatory Coordination Features And Hierarchical Attention Based Text Embeddings},
  author = {Nadee Seneviratne and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2202.06238},
  year   = {2022}
}

备注

Accepted to ICASSP 2022. arXiv admin note: text overlap with arXiv:2104.04195