面向零样本声景映射的三模态嵌入学习
计算机视觉与模式识别
2023-09-20 v1 多媒体
声音
音频与语音处理
摘要
我们关注声景映射任务,其涉及预测在特定地理位置最可能感知到的声音。我们利用近期最先进的模型,通过对比预训练对带有地理标签的音频、音频的文本描述及其采集位置的俯视图像进行编码。最终结果是三种模态的共享嵌入空间,其使得能够从文本或音频查询为任意地理区域构建声景地图。使用 SoundingEarth 数据集,我们发现我们的方法显著优于现有 SOTA,将图像到音频的 Recall@100 从 0.256 提升至 0.450。我们的代码可在 https://github.com/mvrl/geoclap 获取。
引用
@article{arxiv.2309.10667,
title = {Learning Tri-modal Embeddings for Zero-Shot Soundscape Mapping},
author = {Subash Khanal and Srikumar Sastry and Aayush Dhakal and Nathan Jacobs},
journal= {arXiv preprint arXiv:2309.10667},
year = {2023}
}
备注
Accepted at BMVC 2023