中文

Sat2Sound:面向零样态声景映射的统一框架

计算机视觉与模式识别 2026-04-14 v2 人工智能 声音

摘要

我们提出Sat2Sound,一个用于地球表面声景分布预测与映射的统一多模态框架。现有方法依赖成对的卫星图像和带地理位置标记的音频样本,但往往无法捕捉该位置声音的完整多样性。Sat2Sound通过增强数据集,引入语义丰富的、由视觉语言模型生成的声景描述,从而扩展了每个位置可能代表的环境声类型。我们的框架通过对比学习和码本对齐学习,从音频、音频文本描述、卫星图像和合成图像标题中联合学习,发现跨模态共享的"声景概念",实现高精度、可解释的声景映射。Sat2Sound在GeoSound和SoundingEarth基准上实现了卫星图像与音频跨模态检索的状态突破。最后,通过检索可通过文本转音频模型渲染的详细声景描述,Sat2Sound实现了位置条件声景合成,适用于计算资源有限的沉浸式和教育应用。我们的代码和模型已在https://github.com/mvrl/sat2sound上提供。

关键词

引用

@article{arxiv.2505.13777,
  title  = {Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping},
  author = {Subash Khanal and Srikumar Sastry and Aayush Dhakal and Adeel Ahmad and Abby Stylianou and Nathan Jacobs},
  journal= {arXiv preprint arXiv:2505.13777},
  year   = {2026}
}

备注

Accepted to EarthVision 2026