EmoNet:一种用于多语料语音情感识别的迁移学习框架
声音
2021-03-16 v1 机器学习
音频与语音处理
摘要
在本稿件中,从深度迁移学习的角度探讨了多语料语音情感识别(SER)这一主题。我们从若干现有 SER 语料库中组装了一个大型情感语音数据集 EmoSet。EmoSet 总共包含来自 26 个 SER 语料库的 84181 条音频记录,总时长超过 65 小时。该语料库随后被用于创建一个新颖的多语料语音情感识别框架,即 EmoNet。我们将深度 ResNet 架构与残差适配器(residual adapters)的组合从多域视觉识别领域迁移到 EmoSet 上的多语料 SER。与两种合适的基线以及更传统的 ResNet 训练与迁移设置相比,残差适配器方法能够在全部 26 个语料库上以参数高效的方式训练多域 SER 模型。一个共享模型仅使用比在单一数据库上训练的模型多 倍的参数,就在 EmoSet 的 26 个语料库中的 21 个上取得了性能提升。根据 McNemar 检验,这些提升在十个数据集上于 水平下具有显著性,而仅有三个语料库在残差适配器迁移实验中出现了显著的性能下降。最后,我们在 https://github.com/EIHW/EmoNet 上公开了 EmoNet 框架供用户和开发者使用。EmoNet 提供了一个广泛的命令行接口,文档完备,可用于多种多语料迁移学习设置。
引用
@article{arxiv.2103.08310,
title = {EmoNet: A Transfer Learning Framework for Multi-Corpus Speech Emotion Recognition},
author = {Maurice Gerczuk and Shahin Amiriparian and Sandra Ottl and Björn Schuller},
journal= {arXiv preprint arXiv:2103.08310},
year = {2021}
}
备注
18 pages, 7 figures