使用生成对抗网络为情感语音建模特征表示
机器学习
2020-11-16 v1 声音
音频与语音处理
机器学习
摘要
情感识别是一个经典的研究领域,典型流程为提取特征并将其输入分类器进行预测。另一方面,生成模型联合捕获情感与特征轮廓之间的分布关系。相对近期,生成对抗网络(GANs)作为一类新的生成模型出现,并在计算机视觉与自然语言理解领域的分布建模中展现出可观成功。本工作中,我们尝试 GAN 架构的多种变体,以两种方式生成对应于某种情感的特征向量:(i)生成器以混合先验中的样本训练,每个混合分量对应一个情感类别,可采样以生成相应情感的特征;(ii)可显式使用对应于情感的一热向量来生成特征。我们对此类模型进行分析,并提出不同指标用于衡量 GAN 模型生成真实合成样本的能力。除在给定目标数据集上评估外,我们进行了跨语料研究,考察在低资源条件下合成样本作为额外训练数据的效用。
引用
@article{arxiv.1911.00030,
title = {Modeling Feature Representations for Affective Speech using Generative Adversarial Networks},
author = {Saurabh Sahu and Rahul Gupta and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:1911.00030},
year = {2020}
}