中文

面向多语言语音情感识别的语言感知多教师知识蒸馏

计算与语言 2026-01-27 v1 声音 音频与语音处理

摘要

语音情感识别(Speech Emotion Recognition, SER)是改善人机交互的关键技术。尽管在 monolingual SER 上取得了显著进展,但将其扩展到构建 multilingual system 仍面临挑战。我们的目标是训练一个单一模型 capable 实现多语言 SER,通过从多个 teacher model 蒸馏知识来实现。为此,我们引入一种 novel 语言感知 multi-teacher knowledge distillation 方法,以推进英语、芬兰语和法语的 SER。该方法以 Wav2Vec2.0 为 monolingual teacher model 的基础,然后将其知识蒸馏到单个 multilingual student model 中。该 student model 在 English 数据集上实现了 state-of-the-art 性能,weighted recall 为 72.9;在 Finnish 数据集上实现了 unweighted recall 为 63.4,超越了 fine-tuning 和 knowledge distillation 基线方法。我们的 method 在提升 sad 和 neutral 情感的 recall 方面表现突出,尽管在识别 anger 和 happiness 方面仍面临挑战。

关键词

引用

@article{arxiv.2506.08717,
  title  = {Multi-Teacher Language-Aware Knowledge Distillation for Multilingual Speech Emotion Recognition},
  author = {Mehedi Hasan Bijoy and Dejan Porjazovski and Tamás Grósz and Mikko Kurimo},
  journal= {arXiv preprint arXiv:2506.08717},
  year   = {2026}
}

备注

Accepted to INTERSPEECH 2025 conference