用于葡萄牙语语音情感识别的预训练音频神经网络
声音
2022-10-27 v1 机器学习
音频与语音处理
摘要
语音情感识别(SER)的目标是识别语音中的情感方面。针对巴西葡萄牙语语音的 SER 挑战赛提出了葡萄牙语短片段,根据副语言元素(笑、哭等)将其分类为中性、非中性女性和非中性男性。该数据集包含约 分钟的巴西葡萄牙语语音。由于该数据集规模较小,我们研究了迁移学习和数据增强技术的结合是否能产生积极结果。因此,通过将名为 SpecAugment 的数据增强技术与使用预训练音频神经网络进行迁移学习相结合,我们获得了有趣的结果。这些 PANNs(CNN6、CNN10 和 CNN14)在包含超过 小时音频的大型数据集 AudioSet 上进行了预训练。它们在 SER 数据集上进行了微调,在验证集上表现最佳的模型(CNN10)被提交至挑战赛,取得了 的 分数,而挑战赛提供的基线为 。此外,我们还测试了使用在约 小时巴西葡萄牙语音频数据上预训练的 Transformer 神经架构。Transformer 以及更复杂的 PANNs 模型(CNN14)未能泛化到 SER 数据集的测试集,且未超过基线。考虑到数据集规模的限制,目前 SER 的最佳方法是使用 PANNs(特别是 CNN6 和 CNN10)。
引用
@article{arxiv.2210.14716,
title = {Pretrained audio neural networks for Speech emotion recognition in Portuguese},
author = {Marcelo Matheus Gauy and Marcelo Finger},
journal= {arXiv preprint arXiv:2210.14716},
year = {2022}
}