视听合一:基于扩散潜在对齐器的开放域视觉 - 音频生成
计算机视觉与模式识别
2024-02-29 v1 多媒体
声音
音频与语音处理
摘要
视频和音频内容创作是电影行业和专业用户的核心技术。最近,现有的基于扩散的方法分别处理视频和音频生成,这阻碍了该技术从学术界向工业界的转移。在这项工作中,我们旨在填补这一空白,提出一个精心设计的基于优化的框架,用于跨视觉 - 音频和联合视觉 - 音频生成。我们观察到现成的视频或音频生成模型具有强大的生成能力。因此,我们提议通过共享潜在表示空间来桥接现有的强大模型,而不是从头训练巨型模型。具体而言,我们提出了一种结合预训练 ImageBind 模型的多模态潜在对齐器。我们的潜在对齐器核心类似于分类器引导,即在推理时间引导扩散去噪过程。通过精心设计的优化策略和损失函数,我们展示了该方法在联合视频 - 音频生成、视觉引导音频生成和音频引导视觉生成任务上的优越性能。项目网站见 https://yzxing87.github.io/Seeing-and-Hearing/
引用
@article{arxiv.2402.17723,
title = {Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners},
author = {Yazhou Xing and Yingqing He and Zeyue Tian and Xintao Wang and Qifeng Chen},
journal= {arXiv preprint arXiv:2402.17723},
year = {2024}
}
备注
Accepted to CVPR 2024. Project website: https://yzxing87.github.io/Seeing-and-Hearing/