用于语音情感识别的解耦知识蒸馏分层网络
声音
2023-03-10 v1 音频与语音处理
摘要
语音情感识别(SER)的目标是使计算机能够像人类一样识别给定话语的情感类别。SER 的准确性强烈依赖于模型所获得的话语级表征的有效性。然而,非目标类别所携带的“暗知识”总被以往研究忽视。本文提出一种称为 DKDFMH 的分层网络,其在融合多头注意力机制的深度卷积神经网络中采用解耦知识蒸馏。我们的方法应用 logit 蒸馏从不同尺度的注意力集合中获取更高层次的语义特征,并深入挖掘非目标类别所携带的知识,从而引导模型更加关注情感特征之间的差异。为验证模型的有效性,我们在 Interactive Emotional Dyadic Motion Capture(IEMOCAP)数据集上进行了实验,取得了具有竞争力的性能,加权准确率(WA)达 79.1%,非加权准确率(UA)达 77.1%。据我们所知,这是自 2015 年以来 logit 蒸馏首次重回最先进水平(state-of-the-art)。
引用
@article{arxiv.2303.05134,
title = {hierarchical network with decoupled knowledge distillation for speech emotion recognition},
author = {Ziping Zhao and Huan Wang and Haishuai Wang and Bjorn Schuller},
journal= {arXiv preprint arXiv:2303.05134},
year = {2023}
}
备注
5 pages,4 figures,icassp 2023