基于音频、视觉与文本分析的抑郁量表识别
计算机视觉与模式识别
2017-09-19 v1 机器学习
多媒体
摘要
抑郁症是一种主要的心理健康障碍,正迅速影响全球人们的生活。抑郁症不仅影响人的情绪,还影响其身体和心理状态。其症状包括对日常活动缺乏兴趣、情绪低落、焦虑、沮丧、体重减轻甚至自恨。本报告描述了我们在本科二年级暑期实习期间为 Audio Visual Emotion Challenge (AVEC) 2017 所做的工作。随着借助机器学习算法自动检测抑郁症的需求不断增加,我们提出了用于该任务的多模态特征提取与决策级融合方法。通过对提供的 Distress Analysis Interview Corpus-Wizard of Oz (DAIC-WOZ) 数据库进行处理来提取特征。对视觉数据应用了高斯混合模型 (GMM) 聚类和 Fisher 向量方法;对注视、姿态提取了统计描述符;还提取了底层音频特征、头部姿态和文本特征。使用支持向量机 (SVM) 和神经网络对融合特征以及独立特征进行分类。所获得的结果在验证数据集上超过了提供的基线,音频特征提高了 17%,视频特征提高了 24.5%。
引用
@article{arxiv.1709.05865,
title = {Depression Scale Recognition from Audio, Visual and Text Analysis},
author = {Shubham Dham and Anirudh Sharma and Abhinav Dhall},
journal= {arXiv preprint arXiv:1709.05865},
year = {2017}
}