基于集成卷积神经网络的语音抑郁自动检测
音频与语音处理
2024-02-06 v1
摘要
本文提出了一种基于语音的抑郁自动分类方法。该系统基于卷积神经网络 (CNNs) 的集成学习,并使用 2016 年音视频情感挑战赛 (AVEC-2016) 中抑郁分类子挑战赛 (DCC) 提供的数据和实验协议进行评估。在预处理阶段,语音文件被表示为对数语谱图序列,并进行随机采样以平衡正负样本。对于分类任务本身,首先构建了一个基于一个卷积神经网络 (One-Dimensional Convolutional Neural Networks) 的更适合该任务的架构。其次,使用不同的初始化训练多个此类基于 CNN 的模型,然后利用集成平均 (Ensemble Averaging) 算法融合相应的个体预测,并按说话人进行组合以获得适当的最终决策。与基于支持向量机和手工特征的系统、名为 DepAudionet 的基于 CNN+LSTM 的系统以及单个基于 CNN 的分类器相比,所提出的集成系统在 AVEC-2016 的 DCC 上取得了令人满意的结果。
引用
@article{arxiv.2402.02830,
title = {Automatic Detection of Depression in Speech Using Ensemble Convolutional Neural Networks},
author = {Adrián Vázquez-Romero and Ascensión Gallardo-Antolín},
journal= {arXiv preprint arXiv:2402.02830},
year = {2024}
}