中文

面向零样本声景映射的三模态嵌入学习

计算机视觉与模式识别 2023-09-20 v1 多媒体 声音 音频与语音处理

摘要

我们关注声景映射任务,其涉及预测在特定地理位置最可能感知到的声音。我们利用近期最先进的模型,通过对比预训练对带有地理标签的音频、音频的文本描述及其采集位置的俯视图像进行编码。最终结果是三种模态的共享嵌入空间,其使得能够从文本或音频查询为任意地理区域构建声景地图。使用 SoundingEarth 数据集,我们发现我们的方法显著优于现有 SOTA,将图像到音频的 Recall@100 从 0.256 提升至 0.450。我们的代码可在 https://github.com/mvrl/geoclap 获取。

关键词

引用

@article{arxiv.2309.10667,
  title  = {Learning Tri-modal Embeddings for Zero-Shot Soundscape Mapping},
  author = {Subash Khanal and Srikumar Sastry and Aayush Dhakal and Nathan Jacobs},
  journal= {arXiv preprint arXiv:2309.10667},
  year   = {2023}
}

备注

Accepted at BMVC 2023