中文

具有特征融合与关键词到字幕增强的大规模对比语言-音频预训练

声音 2024-03-25 v4 音频与语音处理

摘要

对比学习在多模态表示学习领域已展现出显著成功。本文提出一种对比语言-音频预训练流程,通过将音频数据与自然语言描述相结合来开发音频表示。为实现该目标,我们首先发布 LAION-Audio-630K,一个来自不同数据源、包含 633,526 个音频-文本对的大规模集合。其次,我们考虑不同的音频编码器与文本编码器,构建了对比语言-音频预训练模型。我们将特征融合机制与关键词到字幕(keyword-to-caption)增强纳入模型设计,以进一步使模型能够处理变长音频输入并提升性能。第三,我们开展全面实验,在三项任务上评估我们的模型:文本到音频检索、零样本音频分类与有监督音频分类。结果表明,我们的模型在文本到音频检索任务上取得优越性能。在音频分类任务中,该模型在零样本设定下达到 SOTA 性能,并能在非零点设定下取得与模型结果相当的性能。LAION-Audio-630K 与所提模型均向公众开放。

关键词

引用

@article{arxiv.2211.06687,
  title  = {Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation},
  author = {Yusong Wu and Ke Chen and Tianyu Zhang and Yuchen Hui and Marianna Nezhurina and Taylor Berg-Kirkpatrick and Shlomo Dubnov},
  journal= {arXiv preprint arXiv:2211.06687},
  year   = {2024}
}