利用对抗判别域泛化(ADDoG)改进跨语料库语音情感识别
机器学习
2019-11-05 v2 声音
音频与语音处理
机器学习
摘要
自动语音情感识别为计算机提供了实现用户理解的关键上下文。虽然在同一数据集内训练和测试的方法已被证明是成功的,但当应用于未见过的数据集时,它们往往会失败。为了解决这个问题,最近的工作集中在使用对抗方法来寻找更具泛化性的情感语音表示。然而,这些方法中的许多存在收敛问题,并且仅涉及在实验室条件下收集的数据集。在本文中,我们引入了对抗判别域泛化(ADDoG),它遵循一种更易训练的“中间相遇”方法。该模型迭代地将为每个数据集学到的表示彼此拉近,从而提高跨数据集的泛化能力。我们还引入了多类 ADDoG,即 MADDoG,它能够将所提方法同时扩展到两个以上的数据集。我们的结果表明,所引入的方法具有一致的收敛性,并且在不使用目标数据集标签时结果有显著提升。我们还表明,在大多数情况下,当加入目标数据集标签并考虑真实环境数据时,ADDoG 和 MADDoG 可用于改进基线 SOTA 方法。尽管我们的实验侧重于跨语料库语音情感,但这些方法也可用于消除其他场景中不需要的变异因素。
引用
@article{arxiv.1903.12094,
title = {Improving Cross-Corpus Speech Emotion Recognition with Adversarial Discriminative Domain Generalization (ADDoG)},
author = {John Gideon and Melvin G McInnis and Emily Mower Provost},
journal= {arXiv preprint arXiv:1903.12094},
year = {2019}
}