OMG情感挑战赛——ExCouple团队
声音
2018-05-07 v1 音频与语音处理
摘要
所提模型仅针对音频模块。OMG情感数据集中的所有视频均被转换为WAV文件。所提模型利用半监督学习进行情感识别。以无监督学习方式训练一个GAN,使用另一个数据库(IEMOCAP),并将该GAN结构的一部分(自编码器的一部分)用于音频表征。将以16khz频率、1秒窗口提取音频频谱图,并将其作为以无监督方式使用另一数据库训练的音频表征模型的输入。该音频表征将作为卷积网络和一个带'tanh'激活函数的Dense层的输入,用于预测唤醒度(Arousal)和效价(Valence)值。为拼接1秒长度的音频片段,将取给定话语预测值的中位数。
引用
@article{arxiv.1805.01576,
title = {OMG Emotion Challenge - ExCouple Team},
author = {Ingryd Pereira and Diego Santos},
journal= {arXiv preprint arXiv:1805.01576},
year = {2018}
}