面向自监督语音情感识别的说话人归一化
机器学习
2022-11-08 v2
摘要
大规模的语音情感识别数据集难以获取,而小规模数据集可能包含偏差。基于深度网络的分类器往往会利用这些偏差并寻找捷径,例如说话人特征。这些捷径通常会损害模型的泛化能力。为应对这一挑战,我们提出了一种基于梯度的对抗学习框架,该框架在学习语音情感识别任务的同时,从特征表示中归一化说话人特征。我们在说话人无关和说话人相关两种设定下均证明了方法的有效性,并在具有挑战性的 IEMOCAP 数据集上取得了新的 SOTA 结果。
引用
@article{arxiv.2202.01252,
title = {Speaker Normalization for Self-supervised Speech Emotion Recognition},
author = {Itai Gat and Hagai Aronowitz and Weizhong Zhu and Edmilson Morais and Ron Hoory},
journal= {arXiv preprint arXiv:2202.01252},
year = {2022}
}
备注
ICASSP 22