T-CLAP:时间增强的对比语言-音频预训练
声音
2024-04-30 v1 计算与语言
机器学习
音频与语音处理
摘要
对比语言-音频预训练(CLAP)已被开发用于对齐音频和语言的表示,在检索和分类任务中取得了显著性能。然而,当前的 CLAP 难以捕捉音频和文本特征中的时间信息,这在音频检索和生成等任务中呈现出实质性限制。为了填补这一空白,我们引入了 T-CLAP,一种时间增强的 CLAP 模型。我们使用大语言模型(LLMs)和混合策略,从广泛的音频-文本数据集中为音频片段生成时间对比字幕。随后,设计了一种新的时间聚焦对比损失,通过结合这些合成数据来微调 CLAP 模型。我们在多个下游任务中进行了全面的实验和分析。T-CLAP 在捕捉声音事件的时间关系方面展现出更强的能力,并以显著优势优于 SOTA 模型。
关键词
引用
@article{arxiv.2404.17806,
title = {T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining},
author = {Yi Yuan and Zhuo Chen and Xubo Liu and Haohe Liu and Xuenan Xu and Dongya Jia and Yuanzhe Chen and Mark D. Plumbley and Wenwu Wang},
journal= {arXiv preprint arXiv:2404.17806},
year = {2024}
}
备注
Preprint submitted to IEEE MLSP 2024