深度网络特征用于复杂情绪识别
声音
2018-11-05 v2 机器学习
音频与语音处理
机器学习
摘要
本文研究了不同声学特征、基于音频事件的特征以及基于自动语音翻译的词汇特征在诸如好奇心等复杂情绪识别中的影响。为此,研究了针对不同的基于语音的应用广泛训练的预训练网络,即 AudioSet Net、VoxCeleb Net 和 Deep Speech Net。这些网络深层的信息被视为描述符并编码为特征向量。在包含 8 种复杂情绪的 EmoReact 数据集上的实验结果显示了有效性,取得了 0.85 的最高 F1 分数,而文献中的基线为 0.69。
引用
@article{arxiv.1811.00003,
title = {Deep Net Features for Complex Emotion Recognition},
author = {Bhalaji Nagarajan and V Ramana Murthy Oruganti},
journal= {arXiv preprint arXiv:1811.00003},
year = {2018}
}
备注
Conflict of interest