复杂多模态提示下的音频引导视觉编辑
计算机视觉与模式识别
2025-08-29 v1
摘要
基于扩散模型的视觉编辑已取得显著进展,但通常难以处理仅靠文本指导无法充分描述的复杂场景,这凸显了对额外非文本编辑提示的需求。在本工作中,我们提出了一种新型的音频引导视觉编辑框架,能够在无需额外训练的情况下处理具有多个文本和音频提示的复杂编辑任务。现有的音频引导视觉编辑方法通常需要在特定数据集上进行训练以对齐音频与文本,这限制了它们向现实场景的泛化能力。我们利用一个具有强大零样本能力的多模态预训练编码器,并通过缓解音频编码器空间与扩散模型提示编码器空间之间的差异,将多样化音频集成到视觉编辑任务中。此外,我们通过独立的噪声分支和自适应补丁选择,提出了一种处理具有多个和多模态编辑提示的复杂场景的新方法。我们在多样化编辑任务上的全面实验表明,我们的框架通过整合丰富的音频信息,在文本-only 方法失效的复杂编辑场景中表现出色。
引用
@article{arxiv.2508.20379,
title = {Audio-Guided Visual Editing with Complex Multi-Modal Prompts},
author = {Hyeonyu Kim and Seokhoon Jeong and Seonghee Han and Chanhyuk Choi and Taehwan Kim},
journal= {arXiv preprint arXiv:2508.20379},
year = {2025}
}
备注
Accepted to BMVC 2025