中文

通过数据蒸馏突破语音情感识别资源瓶颈

声音 2025-06-02 v2 人工智能 音频与语音处理

摘要

语音情感识别(SER)在人机交互中发挥着关键作用。物联网(IoT)中边缘设备的出现,由于内存和计算资源的限制,构筑复杂的深度学习模型 presents a 挑战。此外,情感语音数据常包含私人信息,在SER模型部署时可能引发隐私泄露问题。为解决这些挑战,我们提出了一个数据蒸馏框架,用于利用合成的、较小的、从数据集中提炼出的数据集,提高在IoT应用中开发SER模型的效率。我们的实验表明,提炼出的数据集可以有效用于训练使用固定初始化的SER模型,其性能相当于使用原始完整情感语音数据集开发的模型。

关键词

引用

@article{arxiv.2406.15119,
  title  = {Breaking Resource Barriers in Speech Emotion Recognition via Data Distillation},
  author = {Yi Chang and Zhao Ren and Zhonghao Zhao and Thanh Tam Nguyen and Kun Qian and Tanja Schultz and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2406.15119},
  year   = {2025}
}

备注

Accepted by Interspeech 2025