中文

CoLLAP:基于对比学习的长形式语言-音频预训练,结合音乐时间结构增强

声音 2024-10-04 v1 人工智能 音频与语音处理

摘要

建模音频波形的时间特征在表示学习中发挥着重要作用。我们提出Contrastive Long-form Language-Audio Pretraining (CoLLAP),显著扩展输入音频(最长达5分钟)和语言描述(超过250字)的感知窗口,同时实现跨模态和时间动态的对比学习。利用近期Music-LLMs为完整曲目生成长篇音乐描述,并结合音乐时间结构,我们收集了51.3K个音频-文本对,来自大规模AudioSet训练数据集,其中平均音频长度为288秒。我们提出一种新型对比学习架构,通过将每首歌分割为片段并提取其嵌入来融合语言表示与结构化音频表示。通过注意力机制,我们捕获跨模态的时间相关性,允许模型自动加权和增强最终融合得分,以实现更好的对比对齐。最后,我们开发了两种CoLLAP模型变体,使用不同类型的backbone语言模型。通过在多个长形式音乐-文本检索数据集上的全面实验,我们展示了相较于基线方法在检索准确性方面持续性能提升。我们还表明预训练的CoLLAP模型可迁移到各种音乐信息检索任务中,涵盖异构的长形式多模态上下文。

关键词

引用

@article{arxiv.2410.02271,
  title  = {CoLLAP: Contrastive Long-form Language-Audio Pretraining with Musical Temporal Structure Augmentation},
  author = {Junda Wu and Warren Li and Zachary Novack and Amit Namburi and Carol Chen and Julian McAuley},
  journal= {arXiv preprint arXiv:2410.02271},
  year   = {2024}
}

备注

4 pages