SonoWorld:从一张图像生成 3D 音频-视觉场景
计算机视觉与模式识别
2026-03-31 v1 多媒体
声音
摘要
视觉场景生成取得了显著进展,使单张图像可转化为可探索的 3D 世界,但在没有声音的情况下仍不完整。我们提出将单张图像生成 3D 音频-视觉场景的任务,即 Image2AVScene,并介绍了 SonoWorld——首个针对该挑战的框架。从一张图像,我们的管道进行 360{\deg} 全景图像的填充、将其提升到可导航的 3D 场景中、放置语言引导的声音锚点,并渲染用于点、面积和环境源的 ambisonics 音频,从而产生与场景几何和语义相匹配的空间音频。在新筛选的真实世界数据集和受控用户研究中,对我们方法的定量评估确认了其有效性。除了自由视点音频-视觉渲染之外,我们还演示了针对单次声学学习和音频-视觉空间源分离的应用。项目网址:https://humathe.github.io/sonoworld/。
关键词
引用
@article{arxiv.2603.28757,
title = {SonoWorld: From One Image to a 3D Audio-Visual Scene},
author = {Derong Jin and Xiyi Chen and Ming C. Lin and Ruohan Gao},
journal= {arXiv preprint arXiv:2603.28757},
year = {2026}
}
备注
Accepted by CVPR 2026, project page: https://humathe.github.io/sonoworld/