中文

Wav2Small:将 Wav2Vec2 蒸馏至 72K 参数以实现低资源语音情感识别

声音 2024-11-25 v4 音频与语音处理

摘要

语音情感识别(SER)需要克服大量标注员不同意的情况,因而需要较高的计算资源。当前,SER 正在向 arousal、dominance 和 valence(A/D/V)维度标注转变。L2 距离这类通用指标对于评估 A/D/V 准确性并不合适,因为标注员意见无法形成收敛共识。然而,Concordance Correlation Coefficient(CCC)作为 A/D/V 的替代指标,其评估方式是衡量模型输出是否与整个数据集的 CCC 相匹配,而非单个音频的 L2 距离。近期研究表明,wav2vec2 / WavLM 架构输出每个 A/D/V 维度的浮点值,可在 A/D/V 上实现当今的 SOTA CCC。Wav2Vec2.0 / WavLM 系列模型计算开销较大,但使用人工标注训练小模型尚未成功。本文使用大型 Transformer SOTA A/D/V 模型作为教师/标注器,训练 5 个学生模型:4 个 MobileNet 和我们提出的 Wav2Small,仅使用教师的 A/D/V 输出而非人工标注进行训练。我们提出的教师模型也在 MSP Podcast 数据集上取得了新的 SOTA 成绩,valence CCC=0.676。我们选择 MobileNetV4 / MobileNet-V3 作为学生模型,因为 MobileNet 旨在实现快速运行时间。我们还提出了 Wav2Small——一个为最小参数和内存占用而设计的架构。Wav2Small 仅需 120KB 的 .onnx(量化后)文件,即可在资源有限的硬件上实现 A/D/V,参数数量仅为 MobileNet-V4-Small 的 72K,而后者参数为 3.12M。

关键词

引用

@article{arxiv.2408.13920,
  title  = {Wav2Small: Distilling Wav2Vec2 to 72K parameters for Low-Resource Speech emotion recognition},
  author = {Dionyssos Kounadis-Bastian and Oliver Schrüfer and Anna Derington and Hagen Wierstorf and Florian Eyben and Felix Burkhardt and Björn Schuller},
  journal= {arXiv preprint arXiv:2408.13920},
  year   = {2024}
}

备注

apply review