中文

基于轻量级和变换器模型的语音情感检测:比较与消融研究

声音 2025-11-04 v1 人工智能

摘要

从语音中进行情感识别在开发具有同理心的人机交互系统方面发挥着关键作用。本文presents对轻量级变换器模型DistilHuBERT和PaSST进行比较分析,通过对CREMA-D数据集中的六种核心情感进行分类。我们将其性能与使用MFCC特征的传统CNN-LSTM基线模型进行了基准测试。DistilHuBERT在保持异常小模型规模(0.02 MB)的同时,展现出优异的准确率(70.64%)和F1分数(70.36%),均优于PaSST和基线模型。此外,我们对PaSST的三个变体(线性、MLP和注意力池化头)进行了消融研究,以理解分类头结构对模型性能的影响。我们的结果表明,采用MLP头的PaSST在其变体中性能最佳,但仍不及DistilHuBERT。对于情感类别而言,愤怒情感始终被最准确地检测,而厌恶情感则最具挑战性。这些发现表明,轻量级变换器如DistilHuBERT为在边缘设备上实现实时语音情感识别提供了引人入胜的解决方案。代码可在https://github.com/luckymaduabuchi/Emotion-detection-获取。

关键词

引用

@article{arxiv.2511.00402,
  title  = {Emotion Detection in Speech Using Lightweight and Transformer-Based Models: A Comparative and Ablation Study},
  author = {Lucky Onyekwelu-Udoka and Md Shafiqul Islam and Md Shahedul Hasan},
  journal= {arXiv preprint arXiv:2511.00402},
  year   = {2025}
}