中文

发声的图像:在单一画布上组合图像与声音

计算机视觉与模式识别 2025-02-06 v3 机器学习 多媒体 声音 音频与语音处理

摘要

声谱图是声音的二维表示,看起来与我们视觉世界中的图像截然不同。而自然图像作为声谱图播放时,会产生不自然的声音。在本文中,我们表明,可以合成出既看起来像自然图像,又听起来像自然音频的声谱图。我们将这些视觉声谱图称为发声的图像。我们的方法简单且为零样本的,它利用了在共享潜在空间中运行的预训练文本到图像和文本到声谱图扩散模型。在逆向过程中,我们并行使用音频和图像扩散模型对含噪潜在表示进行去噪,从而得到在两个模型下均具有较高似然的样本。通过定量评估和感知研究,我们发现,我们的方法成功生成了既与目标音频提示对齐,又呈现目标图像提示视觉外观的声谱图。请参阅我们的项目页面以获取视频结果:https://ificl.github.io/images-that-sound/

关键词

引用

@article{arxiv.2405.12221,
  title  = {Images that Sound: Composing Images and Sounds on a Single Canvas},
  author = {Ziyang Chen and Daniel Geng and Andrew Owens},
  journal= {arXiv preprint arXiv:2405.12221},
  year   = {2025}
}

备注

Accepted to NeurIPS 2024. Project site: https://ificl.github.io/images-that-sound/