Gen-SER:生成模型遇见语音情感识别
声音
2026-01-29 v1
摘要
语音情感识别(SER)是语音理解与生成中的关键任务。目前的大多数方法基于分类模型或大型语言模型。与之前的方法不同,本文提出了Gen-SER,一种通过生成模型将SER重新表述为分布迁移问题的新方法。我们提出将离散类别标签投影到连续空间,通过正弦分类编码获得终端分布。采用基于目标匹配的生成模型,将初始分布高效地转化为终端分布。通过计算生成的终端分布与真实终端分布的相似度来实现分类。实验结果表明,所提方法有效且具有扩展性,可用于各种语音理解任务,并提示其在更广泛的分类任务中具有潜在应用价值。
引用
@article{arxiv.2601.20573,
title = {Gen-SER: When the generative model meets speech emotion recognition},
author = {Taihui Wang and Jinzheng Zhao and Rilin Chen and Tong Lei and Wenwu Wang and Dong Yu},
journal= {arXiv preprint arXiv:2601.20573},
year = {2026}
}
备注
Accepted to IEEE ICASSP 2026