中文

基于音频、视觉与文本分析的抑郁量表识别

计算机视觉与模式识别 2017-09-19 v1 机器学习 多媒体

摘要

抑郁症是一种主要的心理健康障碍,正迅速影响全球人们的生活。抑郁症不仅影响人的情绪,还影响其身体和心理状态。其症状包括对日常活动缺乏兴趣、情绪低落、焦虑、沮丧、体重减轻甚至自恨。本报告描述了我们在本科二年级暑期实习期间为 Audio Visual Emotion Challenge (AVEC) 2017 所做的工作。随着借助机器学习算法自动检测抑郁症的需求不断增加,我们提出了用于该任务的多模态特征提取与决策级融合方法。通过对提供的 Distress Analysis Interview Corpus-Wizard of Oz (DAIC-WOZ) 数据库进行处理来提取特征。对视觉数据应用了高斯混合模型 (GMM) 聚类和 Fisher 向量方法;对注视、姿态提取了统计描述符;还提取了底层音频特征、头部姿态和文本特征。使用支持向量机 (SVM) 和神经网络对融合特征以及独立特征进行分类。所获得的结果在验证数据集上超过了提供的基线,音频特征提高了 17%,视频特征提高了 24.5%。

关键词

引用

@article{arxiv.1709.05865,
  title  = {Depression Scale Recognition from Audio, Visual and Text Analysis},
  author = {Shubham Dham and Anirudh Sharma and Abhinav Dhall},
  journal= {arXiv preprint arXiv:1709.05865},
  year   = {2017}
}