中文

基于子注意力融合的多模态抑郁估计

计算机视觉与模式识别 2022-08-19 v2 机器人学

摘要

未能及时诊断并有效治疗抑郁导致全球超2.8亿人受此心理疾病困扰。抑郁的信息线索可从多种异构资源(如音频、视觉与文本数据)中获取,这对用于自动估计的新型有效多模态融合方法提出需求。本工作中,我们处理从多模态数据自动识别抑郁的任务,并引入子注意力机制以关联异构信息,同时采用卷积双向LSTM作为骨干网络。为验证该思路,我们在公开DAIC-WOZ抑郁评估基准上开展大量实验,涵盖不同评估模式并考虑性别偏倚。所提模型在检测重度抑郁上取得0.89精度与0.70 F1分数的有效结果,在估计严重度上取得4.92 MAE。我们的基于注意力的融合模块持续优于常规后期融合方法,并与已发表的抑郁估计框架相比取得具竞争力的性能,同时以端到端方式学习诊断该疾病且依赖远更少的预处理步骤。

关键词

引用

@article{arxiv.2207.06180,
  title  = {Multi-modal Depression Estimation based on Sub-attentional Fusion},
  author = {Ping-Cheng Wei and Kunyu Peng and Alina Roitberg and Kailun Yang and Jiaming Zhang and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2207.06180},
  year   = {2022}
}

备注

Accepted to ECCV 2022 ACVR Workshop. Code is publicly available at https://github.com/PingCheng-Wei/DepressionEstimation