面向无源跨语料库语音情感识别的情感感知对比自适应网络
声音
2024-01-24 v1 音频与语音处理
摘要
跨语料库语音情感识别(SER)旨在将情感知识从有标签的源语料库迁移到无标签语料库。然而,先前的方法在自适应期间需要访问源数据,由于数据隐私保护问题,这在现实场景中是无法实现的。本文处理了一项更具实用性的任务,即无源跨语料库 SER,在该任务中,预训练的源模型在不访问源数据的情况下被自适应到目标域。为了解决这个问题,我们提出了一种名为情感感知对比自适应网络(ECAN)的新方法。其核心思想是在考虑全局类级自适应的同时,捕捉样本之间的局部邻域信息。具体来说,我们提出了最近邻对比学习,以促进高度相似样本特征之间的局部情感一致性。此外,仅依赖最近邻可能会导致聚类之间的边界模糊。因此,我们引入了有监督对比学习,以鼓励代表不同情感的聚类之间实现更大的分离,从而促进更好的类级自适应。大量实验表明,我们提出的 ECAN 在多个语音情感语料库的无源跨语料库 SER 设置下显著优于当前最先进的方法。
引用
@article{arxiv.2401.12925,
title = {Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition},
author = {Yan Zhao and Jincen Wang and Cheng Lu and Sunan Li and Björn Schuller and Yuan Zong and Wenming Zheng},
journal= {arXiv preprint arXiv:2401.12925},
year = {2024}
}
备注
Accepted by ICASSP 2024