中文

基于跨模态注意力识别精神分裂症的多模态方法

信号处理 2024-04-22 v3 多媒体 声音 音频与语音处理 图像与视频处理

摘要

本研究关注如何利用人类交流的不同模态来区分健康对照组与表现出强烈阳性症状的精神分裂症受试者。我们开发了一种使用音频、视频与文本的多模态精神分裂症分类系统。从视频和音频中分别提取面部动作单元与声道变量作为低级特征,进而计算高级协调特征,作为音频与视频模态的输入。从语音转写中提取的上下文无关文本嵌入用作文本模态的输入。该多模态系统通过将视频与音频模态的片段到会话级分类器与基于层次注意力网络(HAN)带跨模态注意力的文本模型融合而构建。所提多模态系统的加权平均F1分数比先前最先进多模态系统高出8.53%。

关键词

引用

@article{arxiv.2309.15136,
  title  = {A multi-modal approach for identifying schizophrenia using cross-modal attention},
  author = {Gowtham Premananth and Yashish M. Siriwardena and Philip Resnik and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2309.15136},
  year   = {2024}
}

备注

Accepted to Annual International Conference of the IEEE Engineering in Medicine and Biology Society 2024