从真实场景声音生成逼真图像
计算机视觉与模式识别
2023-09-06 v1 声音
音频与语音处理
摘要
由于声音与图像之间缺乏配对数据集,且两种模态的特征差异显著,将真实场景声音表示为图像是一项重要但具有挑战性的任务。以往研究集中于从有限类别的声音或音乐生成图像。本文中,我们提出一种从真实场景声音生成图像的新方法。首先,我们利用音频描述将声音转换为文本。其次,我们提出音频注意力和句子注意力以表征声音的丰富特征并可视化声音。最后,我们提出基于 CLIPscore 和 AudioCLIP 的直接声音优化,并利用基于扩散的模型生成图像。实验表明,我们的模型能够从真实场景声音生成高质量图像,并在真实音频数据集的定量与定性评估中优于基线方法。
引用
@article{arxiv.2309.02405,
title = {Generating Realistic Images from In-the-wild Sounds},
author = {Taegyeong Lee and Jeonghun Kang and Hyeonyu Kim and Taehwan Kim},
journal= {arXiv preprint arXiv:2309.02405},
year = {2023}
}
备注
Accepted to ICCV 2023