DSNet:基于中性校准的解耦孪生网络用于语音情感识别
声音
2023-12-27 v1 人工智能
音频与语音处理
摘要
基于深度学习的语音情感识别(SER)中一个长期存在的挑战是情感无关因素(如说话人或语音变化)的无意识编码,这限制了SER在实际应用中的泛化能力。本文提出DSNet,一种带有中性校准的解耦孪生网络,以满足对更鲁棒和可解释的SER模型的需求。具体而言,我们引入一个正交特征解耦模块,将高层表示显式投影到两个不同的子空间。随后,我们提出一种新颖的中性校准机制,鼓励一个子空间捕获足够的情感无关信息。这样,另一个子空间就能更好地隔离并强调语音信号中的情感相关信息。在两个流行基准数据集上的实验结果表明,DSNet在说话人无关的SER任务上优于多种最先进方法。
引用
@article{arxiv.2312.15593,
title = {DSNet: Disentangled Siamese Network with Neutral Calibration for Speech Emotion Recognition},
author = {Chengxin Chen and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2312.15593},
year = {2023}
}
备注
15 pages, 4 figures