SmoothCLAP:面向情感计算的软目标增强对比语言-音频预训练
声音
2026-01-21 v1 音频与语音处理
摘要
人类情感的模糊性给机器学习模型带来了若干挑战,因为情感常常重叠且缺乏清晰的界定边界。对比语言-音频预训练(CLAP)已成为可泛化情感识别的关键技术。然而,由于传统的CLAP强制要求配对的音频-文本样本之间进行严格的一一对应,它忽略了模态内的相似性,并将所有不匹配的对视为同等负例。这与不同情感之间的模糊边界相冲突。为了解决这一局限性,我们提出了SmoothCLAP,它引入了从模态内相似性和副语言特征中导出的软化目标。通过将这些软化目标与传统的对比监督相结合,SmoothCLAP学习到的嵌入尊重了分级的情感关系,同时保留了与CLAP相同的推理流程。在英语和德语的八项情感计算任务上的实验表明,SmoothCLAP持续取得了优越的性能。我们的结果强调,利用软监督是构建情感感知音频-文本模型的一种有前景的策略。
引用
@article{arxiv.2601.12591,
title = {SmoothCLAP: Soft-Target Enhanced Contrastive Language\--Audio Pretraining for Affective Computing},
author = {Xin Jing and Jiadong Wang and Andreas Triantafyllopoulos and Maurice Gerczuk and Shahin Amiriparian and Jun Luo and Björn Schuller},
journal= {arXiv preprint arXiv:2601.12591},
year = {2026}
}
备注
5 pages, accepted by ICASSP 2026