中文

WavLink:基于全局 Whisper Token 的紧凑音频-文本嵌入

声音 2026-01-23 v2 计算与语言 机器学习

摘要

Whisper 已成为大型音频语言模型中提取通用音频特征的事实上的编码器,其中 30 秒的片段通常由投影到 LLM 中的 1500 个帧特征表示。相比之下,基于 CLAP 的音频-文本嵌入模型等大多依赖替代音频编码器(例如 HTS-AT、PaSST),并未有效利用 Whisper。我们提出了 WavLink,一种紧凑的音频-文本嵌入模型,它通过一个可学习的全局 token 增强 Whisper 编码器,并与文本编码器联合训练。通过对设计选择(包括预训练文本编码器、损失函数、训练模式和数据混合)的系统研究,我们确定了能产生 SOTA 检索性能的配置。我们在三种模型规模上的两阶段训练方案结合 Matryoshka 风格的监督,提高了可扩展性,在性能损失极小的情况下实现了 8 倍更小的嵌入。WavLink 在带有 MCQs 的 AIR-Bench 和零样本分类上也展示了有竞争力的性能。

关键词

引用

@article{arxiv.2601.15118,
  title  = {WavLink: Compact Audio-Text Embeddings with a Global Whisper Token},
  author = {Gokul Karthik Kumar and Ludovick Lepauloux and Hakim Hacid},
  journal= {arXiv preprint arXiv:2601.15118},
  year   = {2026}
}

备注

Accepted at ICASSP 2026