揭示说话人嵌入中的情感聚类:用于语音情感识别的对比学习策略
音频与语音处理
2024-06-03 v1 机器学习
声音
摘要
说话人嵌入携带有价值的情感相关信息,这使其成为增强语音情感识别(SER)的有前途的资源,尤其是在标记数据有限的情况下。传统上,人们假设情感信息间接嵌入在说话人嵌入中,导致其未被充分利用。我们的研究揭示了情感与最先进的说话人嵌入之间以说话人内聚类形式存在的直接且有用的联系。通过进行彻底的聚类分析,我们证明情感信息可以很容易地从说话人嵌入中提取出来。为了利用这一信息,我们引入了一种新颖的对比预训练方法,应用于情感未标记数据以进行语音情感识别。所提出的方法涉及基于说话人嵌入的说话人内聚类对正例和负例进行采样。所提出的策略利用了大量的情感未标记数据,无论是作为独立的预训练任务还是集成到多任务预训练设置中,都能显著提高SER性能。
引用
@article{arxiv.2401.11017,
title = {Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition},
author = {Ismail Rasim Ulgen and Zongyang Du and Carlos Busso and Berrak Sisman},
journal= {arXiv preprint arXiv:2401.11017},
year = {2024}
}
备注
Accepted to ICASSP 2024