GeoDiT:地理情境声景到景观生成
声音
2026-03-03 v2 人工智能
图形学
人机交互
音频与语音处理
摘要
最近的音频到图像模型在生成以特定声音为条件的特定对象图像方面表现突出。然而,这些模型无法从环境声景重建真实世界景观。为填补这一差距,我们提出了地理情境声景到景观 (GeoS2L) 生成,这是一种新颖且具有实际意义的任务,旨在从环境声景合成地理上真实的景观图像。为支持这一任务,我们构建了两个大规模地理情境多模态数据集 SoundingSVI 和 SonicUrban,将多样化的环境声景与真实世界景观图像配对。我们提出了 SounDiT,一种基于扩散转换器 (DiT) 的模型,融合环境声景和地理情境场景条件,以合成地理一致的景观图像。此外,我们提出了 Place Similarity Score (PSS),一种以实际为导向的地理情境评估框架,用于衡量输入声景与生成景观图像之间的一致性。大量实验表明,SounDiT 在 GeoS2L 中超越了现有基线,而 PSS 有效捕捉了元素、场景和人类感知层面的多级生成一致性。项目页面:https://gisense.github.io/SounDiT-Page/
引用
@article{arxiv.2505.12734,
title = {SounDiT: Geo-Contextual Soundscape-to-Landscape Generation},
author = {Junbo Wang and Haofeng Tan and Bowen Liao and Albert Jiang and Teng Fei and Qixing Huang and Bing Zhou and Zhengzhong Tu and Shan Ye and Yuhao Kang},
journal= {arXiv preprint arXiv:2505.12734},
year = {2026}
}
备注
12 pages, 4 figures