基于知识蒸馏的轻量化语音情感识别
机器学习
2025-07-02 v1 人机交互
多媒体
音频与语音处理
图像与视频处理
信号处理
摘要
语音界面是人机交互系统的重要组成部分,语音情感识别(SER)可用于根据用户情绪定制响应。由于人类通过多模态音视频线索表达情绪,开发基于两种模态的 SER 系统具有利益。然而,获取其开发所需的大量标注数据成本高昂。本文提出一种知识蒸馏框架 LightweightSER(LiSER),利用大规模未标注音视频数据进行 SER,使用基于先进语音和面部表示模型构建的大型教师模型。LiSER 将关于语音情绪和面部表情的知识从教师模型传递给轻量级学生模型。在两个基准数据集 RAVDESS 和 CREMA-D 上的实验表明,LiSER 可以减少 SER 任务对大量标注数据集的依赖。
引用
@article{arxiv.2507.00055,
title = {Leveraging Unlabeled Audio-Visual Data in Speech Emotion Recognition using Knowledge Distillation},
author = {Varsha Pendyala and Pedro Morgado and William Sethares},
journal= {arXiv preprint arXiv:2507.00055},
year = {2025}
}
备注
Accepted at INTERSPEECH 2025