中文

CLEP-DG:基于软提示调谐的语音情感领域对比学习

声音 2025-07-08 v1 音频与语音处理

摘要

语音情感识别(SER)是情感计算和人机交互的基本任务,但现有模型在不同声学条件下难以泛化。虽然对比语言-音频预训练(CLAP)提供了强大的多模态对齐,但缺乏专门捕获情感线索的机制,使其对SER不够理想。为此,我们提出CLEP-DG,一个增强CLAP在情感识别方面鲁棒性的框架。首先,我们在大规模情感语音数据集上微调CLAP以获得CLEP,使其更好地编码情感相关特征。然后,我们引入声学上下文提示调谐(ACPT),这是一种基于文本的增强策略,通过优化可学习的提示向量来建模多样化的声学环境,而无需额外标记的音频。最后,利用跨模态可迁移性,我们在文本派生的嵌入上训练分类器,并将其应用于音频编码器,以减轻文本监督与音频基于情感识别之间的领域偏移。在五个基准数据集上的实验表明,CLEP-DG在监督学习和领域泛化设置下均优于先前的CLAP方法,实现了领先的性能。

关键词

引用

@article{arxiv.2507.04048,
  title  = {CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning},
  author = {Jiacheng Shi and Yanfu Zhang and Ye Gao},
  journal= {arXiv preprint arXiv:2507.04048},
  year   = {2025}
}

备注

Accepted to Interspeech2025