SEE-2-SOUND:零样本空间环境到空间声音
计算机视觉与模式识别
2025-07-08 v2 机器学习
声音
音频与语音处理
摘要
生成组合视觉和听觉感官体验对于沉浸式内容消费至关重要。近期神经生成模型的进展已使图像、文本、语音和视频等多模态高分辨率内容的创建成为可能。尽管如此,在生成与生成视觉内容相容的高质量空间音频方面仍存在显著差距。此外,当前音频生成模型在生成自然音频或语音或音乐方面表现优异,但在整合实现沉浸式体验所必需的空间音频线索方面不足。本文引入 SEE-2-SOUND,一种零样本方法,将任务分解为 (1)识别视觉感兴趣区域;(2)在三维空间中定位这些元素;(3)为每个元素生成单声道音频;以及 (4)将其集成到空间音频中。使用我们的框架,我们为生成高质量视频、图像和来自互联网的动态图像,以及由学习方法生成的媒体 demonstrate 令人瞩目的空间音频生成结果。
引用
@article{arxiv.2406.06612,
title = {SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound},
author = {Rishit Dagli and Shivesh Prakash and Robert Wu and Houman Khosravani},
journal= {arXiv preprint arXiv:2406.06612},
year = {2025}
}
备注
Project Page: https://see2sound.github.io/