ParaCLAP——面向计算副语言任务的通用语言-音频模型
声音
2024-06-12 v1 音频与语音处理
摘要
对比语言-音频预训练(CLAP)最近已成为一种使音频分析更具泛化能力的方法。具体来说,CLAP 风格的模型能够“回答”多样化的语言查询,将音频模型的能力扩展到封闭标签集之外。然而,CLAP 依赖于大量(音频,查询)对进行预训练。虽然此类数据集可用于通用音频任务(如字幕生成或声音事件检测),但尚无针对计算副语言(CP)任务的匹配音频和文本查询数据集。因此,该领域依赖于为通用音频训练的通用 CLAP 模型,但效果有限。在本研究中,我们探讨了 ParaCLAP(一种适用于 CP 的 CLAP 风格模型)的训练考量,包括一种创建音频-语言查询的新颖流程。我们在一组计算副语言任务上展示了其有效性,结果表明它超越了开源最先进模型的性能。
引用
@article{arxiv.2406.07203,
title = {ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks},
author = {Xin Jing and Andreas Triantafyllopoulos and Björn Schuller},
journal= {arXiv preprint arXiv:2406.07203},
year = {2024}
}
备注
Accepted by Interspeech 2024