通过多层融合和副语言特征集成恢复语音情感识别中离散标记的性能
音频与语音处理
2026-01-27 v1 机器学习
声音
摘要
离散语音标记在存储和语言模型集成方面具有显著优势,但其在语音情感识别(SER)中的应用受到量化过程中副语言信息丢失的限制。本文全面系统地探索了离散标记用于 SER 的可能性。使用微调的 WavLM-Large 模型,我们系统量化了不同层配置和 k-means 量化粒度下的性能下降。为恢复信息损失,我们提出两种关键策略:(1) 基于注意力的多层融合以重新捕获不同层的互补信息;(2) 集成 openSMILE 特征以显式重新引入副语言线索。我们还比较了主流神经音频编解码器标记化器(SpeechTokenizer、DAC、EnCodec),并分析它们在与声学特征融合时的数据行为。我们的发现表明,通过多层融合和声学特征集成,离散标记可在 SER 任务中弥补与连续表示之间的性能差距。
引用
@article{arxiv.2601.17085,
title = {Recovering Performance in Speech Emotion Recognition from Discrete Tokens via Multi-Layer Fusion and Paralinguistic Feature Integration},
author = {Esther Sun and Abinay Reddy Naini and Carlos Busso},
journal= {arXiv preprint arXiv:2601.17085},
year = {2026}
}
备注
Accepted to ICASSP 2026