中文

面向零样本文本驱动图像编辑的区域感知扩散模型

计算机视觉与模式识别 2023-02-24 v1 图形学 多媒体

摘要

在文本描述引导下的图像操控近年来受到广泛关注。本研究中,我们关注在给定文本提示引导下的图像区域编辑。与当前基于掩码的图像编辑方法不同,我们提出一种新颖的用于实体级图像编辑的区域感知扩散模型(RDM),其可自动定位感兴趣区域并依据给定文本提示进行替换。为在图像保真度与推理速度间取得平衡,我们通过结合隐空间扩散与增强方向引导设计了密集型扩散流程。此外,为保留非编辑区域的图像内容,我们引入区域感知实体编辑以修改感兴趣区域并保留非感兴趣区域。我们通过大量定性与定量实验验证了所提 RDM 优于基线方法。结果表明,RDM 在视觉质量、整体协调性、非编辑区域内容保持及文本-图像语义一致性方面均优于先前方法。代码见 https://github.com/haha-lisa/RDM-Region-Aware-Diffusion-Model。

关键词

引用

@article{arxiv.2302.11797,
  title  = {Region-Aware Diffusion for Zero-shot Text-driven Image Editing},
  author = {Nisha Huang and Fan Tang and Weiming Dong and Tong-Yee Lee and Changsheng Xu},
  journal= {arXiv preprint arXiv:2302.11797},
  year   = {2023}
}