面向语音情感与抑郁识别的鲁棒深度神经网络
人机交互
2020-11-19 v4 声音
音频与语音处理
摘要
近年来,智能监控系统与情感计算应用不断涌现以增强医疗保健。这些应用的例子包括对主要抑郁障碍(MDD)等情感状态的评估。MDD 表现为某些情绪的持续表达:负面情绪(低效价)和缺乏兴趣(低唤醒度)。高性能智能系统将增强 MDD 的早期诊断。在本文中,我们提出了一种称为 EmoAudioNet 的新型深度神经网络架构,用于从语音中识别情感与抑郁。Deep EmoAudioNet 从音频信号的时间-频率表示及其频率谱的视觉表示中学习。我们的模型在预测情感与抑郁方面显示出非常有前景的结果。根据在 RECOLA 和 DAIC-WOZ 数据集上预测唤醒度、效价和抑郁的若干评估指标,其表现与最先进方法相似或优于最先进方法。EmoAudioNet 的代码已在 GitHub 公开:https://github.com/AliceOTHMANI/EmoAudioNet
引用
@article{arxiv.1911.00310,
title = {Towards Robust Deep Neural Networks for Affect and Depression Recognition from Speech},
author = {Alice Othmani and Daoud Kadoch and Kamil Bentounes and Emna Rejaibi and Romain Alfred and Abdenour Hadid},
journal= {arXiv preprint arXiv:1911.00310},
year = {2020}
}
备注
16 pages, 2 figures, 1 algorithm and 6 tables