基于阶梯网络的半监督语音情感识别
音频与语音处理
2023-05-15 v1
摘要
语音情感识别(SER)系统在医疗、教育以及安全与国防等多个领域有应用。这些系统的一个主要缺陷是跨不同条件的泛化能力不足。该问题可通过在来自目标域的大量标注数据上训练模型来解决,但这昂贵且耗时。另一种方法是提升模型的泛化能力。实现此目标的一种有效方式是通过多任务学习(MTL)对模型正则化,即在与主任务一起学习辅助任务。这些方法常需要使用标注数据,而情感识别中收集此类数据计算成本高昂(性别、说话人身份、年龄或其他情感描述符)。本研究提出使用阶梯网络进行情感识别,其利用无监督辅助任务。主任务为预测情感属性的回归问题。辅助任务为使用去噪自编码器重建中间特征表示。该辅助任务不需要标签,因此可以以半监督方式用来自目标域的大量无标签数据训练框架。本研究表明所提方法为 SER 创建了强大框架,取得了优于全监督单任务学习(STL)和 MTL 基线的性能。该方法用若干声学特征实现,表明阶梯网络在跨语料库设定下泛化显著更好。与 STL 基线相比,所提方法在语料库内评估中一致性相关系数(CCC)相对提升介于 3.0% 与 3.5% 之间,在跨语料库评估中介于 16.1% 与 74.1% 之间,凸显了该架构的能力。
引用
@article{arxiv.1905.02921,
title = {Semi-Supervised Speech Emotion Recognition with Ladder Networks},
author = {Srinivas Parthasarathy and Carlos Busso},
journal= {arXiv preprint arXiv:1905.02921},
year = {2023}
}