基于文本与图像引导的统一扩散刚性与非刚性编辑
计算机视觉与模式识别
2024-01-05 v1
摘要
现有的文本到图像编辑方法往往在刚性或非刚性编辑中单方面表现优异,但在结合两者时面临挑战,导致输出结果与提供的文本提示不对齐。此外,集成参考图像以进行控制仍然具有挑战性。为了解决这些问题,我们提出了一种多功能的图像编辑框架,能够在文本提示或参考图像的引导下执行刚性和非刚性编辑。我们利用双路径注入方案来处理多样化的编辑场景,并引入集成的自注意力机制以融合外观与结构信息。为了减轻潜在的视觉伪影,我们进一步采用潜在融合技术来调整中间潜变量。与先前的工作相比,我们的方法在实现精确且多功能的图像编辑方面取得了显著进展。综合实验验证了我们方法的有效性,在涵盖刚性与非刚性设置的基于文本的编辑和外观迁移任务中展现出具有竞争力或更优的结果。
引用
@article{arxiv.2401.02126,
title = {Unified Diffusion-Based Rigid and Non-Rigid Editing with Text and Image Guidance},
author = {Jiacheng Wang and Ping Liu and Wei Xu},
journal= {arXiv preprint arXiv:2401.02126},
year = {2024}
}
备注
15 pages, 13 figures