中文

面向移动端的蒸馏版 HuBERT 语音情感识别:跨语料库验证研究

声音 2026-01-01 v2 人工智能

摘要

语音情感识别(SER)具有巨大的潜力可用于移动应用,但由于基于最先进的变换器架构的计算需求,实际部署仍受限。本文提出基于 DistilHuBERT 的移动端高效 SER 系统,该模型为压缩版且 8 位量化后的变换器,实现约 92% 的参数降低,同时保持具竞争力的准确率。我们对 IEMOCAP 数据集进行严格的 5 折留会前会检验(Leave-One-Session-Out, LOSO)交叉验证,以确保说话人独立性,并通过在 CREMA-D 上的跨语料库训练来增强泛化能力。跨语料库训练在 CREMA-D 上的结果显示,加权准确率提升 1.2%,宏平均 F1 分数提升 1.4%,跨折方差降低 32%,其中最显著的益处体现在中性类,F1 分数提升 5.4%。本方法实现 61.4% 的无加权准确率,模型占用仅 23 MB,约为全规模基线的 91%。在 RAVDESS 上进行跨语料库评估发现,戏剧性情绪的呈现会导致预测按唤醒程度聚集,而非按具体情绪类别——幸福预测系统性地流向愤怒预测,悲伤预测流向中性预测,这是由于演员为清晰度而非细腻度而导致的声学饱和。尽管这种戏剧性效应将 RAVDESS 的整体准确率降至 46.64%,但该模型仍能在情绪唤醒检测方面保持稳健:对愤怒的召回率达 99%,对中性的召回率为 55%,对悲伤的召回率为 27%。这些发现表明该方法在模型规模与准确率之间实现了帕累托最优的权衡,使其能够在资源受限的移动设备上实现实际的情感识别。

关键词

引用

@article{arxiv.2512.23435,
  title  = {Distilled HuBERT for Mobile Speech Emotion Recognition: A Cross-Corpus Validation Study},
  author = {Saifelden M. Ismail},
  journal= {arXiv preprint arXiv:2512.23435},
  year   = {2026}
}

备注

5 pages, 2 tables, 1 figure. Not yet submitted to a conference