Sound2Vision:通过跨模态潜在对齐生成多样化视觉内容
计算机视觉与模式识别
2024-12-10 v1 多媒体
声音
音频与语音处理
摘要
音频如何描述我们周围的世界?本文提出一种方法,用于从多样化野外声音生成图像中的视觉场景。这种跨模态生成任务因听觉信号与视觉信号之间的巨大信息鸿沟而具有挑战性。我们通过设计模型对齐音视频模态,通过丰富音频特征中的视觉信息并将其转化为视觉潜在空间来实现此目标。随后将这些特征输入预训练的图像生成器以生成图像。为提升图像质量,我们利用声源定位选择具有强跨模态相关性的音视频配对。我们的方法在VEGAS和VGGSound数据集上显著优于前人工作,演示了通过对输入波形或潜在空间进行简单操作来控制生成过程。此外,我们分析了所学习嵌入空间的几何特性,证明了所提学习方法有效对齐音视频信号以实现跨模态生成。基于此分析,我们展示该方法对特定设计选择不敏感,通过集成各种模型架构和不同类型的音视频数据显示其通用性。
引用
@article{arxiv.2412.06209,
title = {Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment},
author = {Kim Sung-Bin and Arda Senocak and Hyunwoo Ha and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2412.06209},
year = {2024}
}
备注
Under-review