中文

基于音频到视觉潜空间对齐的声音到视觉场景生成

计算机视觉与模式识别 2023-03-31 v1 多媒体 声音 音频与语音处理 图像与视频处理

摘要

声音如何描述我们周围的世界?在本文中,我们提出了一种从声音生成场景图像的方法。我们的方法解决了处理视觉与听觉之间经常存在的巨大鸿沟这一挑战。我们设计了一个模型,通过调度各模型组件的学习过程来关联视听模态,尽管它们之间存在信息鸿沟。其核心思想是通过学习将音频对齐到视觉潜空间,以视觉信息丰富音频特征。我们将输入音频转换为视觉特征,然后使用预训练生成器生成图像。为了进一步提高生成图像的质量,我们利用声源定位来选择具有强跨模态相关性的视听对。我们在 VEGAS 和 VGGSound 数据集上取得了比先前方法明显更好的结果。我们还展示了可以通过对输入波形或潜空间施加简单操作来控制我们模型的预测。

关键词

引用

@article{arxiv.2303.17490,
  title  = {Sound to Visual Scene Generation by Audio-to-Visual Latent Alignment},
  author = {Kim Sung-Bin and Arda Senocak and Hyunwoo Ha and Andrew Owens and Tae-Hyun Oh},
  journal= {arXiv preprint arXiv:2303.17490},
  year   = {2023}
}

备注

CVPR 2023