中文

无需音频-图像配对的音频到图像鸟类种类检索:基于文本蒸馏

声音 2026-04-07 v2 信息检索 机器学习

摘要

音频到图像检索为生物声学种类识别提供了可解释的替代方案,但由于稀缺的音频-图像配对数据,学习对齐的音频-图像表征面临挑战。我们提出一种简单且数据高效的方法,使无需任何音频-图像监督即可实现音频到图像检索。我们的方法使用文本作为语义中介:我们将预训练的图像-文本模型 (BioCLIP-2) 的文本嵌入空间蒸馏到预训练的音频-文本模型 (BioLingual) 中,通过微调其音频编码器以对比目标函数进行训练。该蒸馏将视觉上具备语义的内容传输到音频表征中,导致音频和图像嵌入之间出现新兴的对齐,尽管在训练期间未使用图像。我们在多个生物声学基准数据集上对所得模型进行评估。蒸馏后的音频编码器保留了音频判别能力,同时在焦点录音和声景数据集上显著提高了音频-文本对齐。最重要的是,在 SSW60 数据集上,本方法的音频到图像检索性能显著优于基于零样本模型组合或学习的文本嵌入之间的映射所基于的基线方法,尽管未在配对音频-图像数据上进行训练。这些结果表明,通过文本实现的间接语义传递足以诱导有意义的音频-图像对齐,为数据稀缺的生物声学环境中实现视觉上具语义的种类识别提供了实用解决方案。

关键词

引用

@article{arxiv.2602.00681,
  title  = {Audio-to-Image Bird Species Retrieval without Audio-Image Pairs via Text Distillation},
  author = {Ilyass Moummad and Marius Miron and Lukas Rauch and David Robinson and Alexis Joly and Olivier Pietquin and Emmanuel Chemla and Matthieu Geist},
  journal= {arXiv preprint arXiv:2602.00681},
  year   = {2026}
}