RA-CLAP:用于语音检索的关系增强情感说话风格对比语言-音频预训练
声音
2025-05-27 v1 音频与语音处理
摘要
对比语言-音频预训练(Contrastive Language-Audio Pretraining, CLAP)模型在通用音频描述相关任务(如音频检索)中展现出了优异的性能。然而,在新兴的情感说话风格描述(emotional speaking style description, ESSD)领域,跨模态对比预训练在很大程度上仍未被探索。在本文中,我们提出了一项名为情感说话风格检索(emotional speaking style retrieval, ESSR)的新颖语音检索任务,以及 ESS-CLAP,一个专为学习语音与自然语言描述之间关系而定制的情感说话风格 CLAP 模型。此外,我们进一步提出了关系增强 CLAP(RA-CLAP),以解决传统方法假设字幕与音频之间存在严格二元关系的局限性。该模型利用自蒸馏来学习语音与描述之间潜在的局部匹配关系,从而增强泛化能力。实验结果验证了 RA-CLAP 的有效性,为 ESSD 提供了有价值的参考。
引用
@article{arxiv.2505.19437,
title = {RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval},
author = {Haoqin Sun and Jingguang Tian and Jiaming Zhou and Hui Wang and Jiabei He and Shiwan Zhao and Xiangyu Kong and Desheng Hu and Xinkang Xu and Xinhui Hu and Yong Qin},
journal= {arXiv preprint arXiv:2505.19437},
year = {2025}
}