利用语义信息通过音文本蒸馏模型实现高效自监督情感识别
音频与语音处理
2023-09-20 v1 机器学习
声音
摘要
在很大程度上由于其隐式语义建模,自监督学习(SSL)方法显著提升了语音情感识别(SER)系统中效价识别的性能。然而,其庞大的规模常阻碍实际部署。本文以 HuBERT 作为 SSL 模型示例,分析其各层对 SER 的相关性。我们发现浅层对唤醒度识别更重要,而深层对效价更重要。该观察揭示了额外文本信息对准确效价识别的重要性,因为蒸馏框架缺乏其大规模 SSL 教师模型的深度。因此,我们提出一种音文本蒸馏 SSL 框架,其可训练参数仅为大规模 SSL 模型的约 20%,却在 MSP-Podcast v1.10 数据集上于三个情感维度(唤醒度、效价、支配度)取得相当性能。
引用
@article{arxiv.2305.19184,
title = {Leveraging Semantic Information for Efficient Self-Supervised Emotion Recognition with Audio-Textual Distilled Models},
author = {Danilo de Oliveira and Navin Raj Prabhu and Timo Gerkmann},
journal= {arXiv preprint arXiv:2305.19184},
year = {2023}
}
备注
Accepted at Interspeech 2023