听见声音:用于音频到图像生成的视觉声音拼接
声音
2025-01-10 v1 计算机视觉与模式识别
图形学
音频与语音处理
摘要
训练音频到图像生成模型需要大量来自不同音视频对的语义对齐数据。此类数据几乎总是从野外视频中收集,因为它们天然地具有跨模态语义对应性。在本工作中,我们假设坚持要求绝对的音频-视频对应性的做法,不仅是不必要的,也会严重限制数据的规模、质量和多样性,从而损害其在现代生成模型中的使用。也就是说,我们提出了一种可扩展的图像声学化框架,其中来自多种高质量但单模态来源的实例可以通过由现代视觉语言模型所赋予推理能力的检索过程人工拼接。为了展示该方法的有效性,我们使用声学化后的图像训练一个音频到图像的生成模型,该模型在与最先进技术相当的性能上。最后,通过一系列消融研究,我们展示了模型隐式发展出的几种有趣的听觉能力,包括语义混合和插值、音量校准以及通过混响实现的声学空间建模,这些能力用于引导图像生成过程。
引用
@article{arxiv.2501.05413,
title = {Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation},
author = {Darius Petermann and Mahdi M. Kalayeh},
journal= {arXiv preprint arXiv:2501.05413},
year = {2025}
}