中文

SLAP:面向可变时长音频与多目标训练的可扩展语言-音频预训练

音频与语音处理 2026-01-21 v1 人工智能 声音

摘要

对比语言-音频预训练(CLAP)在学习语义丰富的音频表示方面取得了显著成功,并被广泛用于各种音频相关任务。然而,当前的CLAP模型面临几个关键限制。首先,它们通常在相对较小的数据集上进行训练,通常包含几百万个音频样本。其次,现有的CLAP模型局限于短且固定的时长,这限制了它们在具有可变时长音频的真实场景中的使用。第三,标准的对比训练目标作用于全局表示,这可能阻碍学习密集的、细粒度的音频特征。为了应对这些挑战,我们引入了可扩展语言-音频预训练(SLAP),它将语言-音频预训练扩展到包含可变音频时长的1.09亿个音频-文本对,并整合了多个训练目标。SLAP在单阶段训练中统一了对比损失与额外的自监督和字幕损失,促进了更丰富的密集音频表示的学习。所提出的SLAP模型在音频-文本检索和零样本音频分类任务上取得了新的最先进性能,证明了其在多样化基准测试中的有效性。

关键词

引用

@article{arxiv.2601.12594,
  title  = {SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training},
  author = {Xinhao Mei and Gael Le Lan and Haohe Liu and Zhaoheng Ni and Varun Nagaraja and Yang Liu and Yangyang Shi and Vikas Chandra},
  journal= {arXiv preprint arXiv:2601.12594},
  year   = {2026}
}

备注

Accepted to ICASSP 2026