基于自编码器码本的音频词袋用于连续情绪预测
音频与语音处理
2019-07-12 v1 机器学习
声音
机器学习
摘要
本文提出一种基于神经网络码本提取词袋(BoW)表示的新方法。常规BoW模型基于从基本表示构建的字典(码本),这些基本表示随机选取或通过训练集上的聚类算法选取。随后使用度量将未见基本表示分配给最近的字典条目以产生直方图。在所提方法中,自编码器(AE)兼具字典创建与分配度量的作用。AE编码层的维度对应字典大小,其神经元输出代表分配度量。在AVEC 2017音频数据集上连续情绪预测任务的实验结果显示,相对于基线系统中实现的常规BoW版本,一致性相关系数(CCC)在唤醒维度从0.225提升至0.322,在效价维度从0.244提升至0.368。
引用
@article{arxiv.1907.04928,
title = {Bag-of-Audio-Words based on Autoencoder Codebook for Continuous Emotion Prediction},
author = {Mohammed Senoussaoui and Patrick Cardinal and Alessandro Lameiras Koerich},
journal= {arXiv preprint arXiv:1907.04928},
year = {2019}
}