中文

实体级文本引导图像操控

计算机视觉与模式识别 2023-02-23 v1

摘要

现有的文本引导图像操控方法旨在修改图像外观或在虚拟或简单场景中编辑少数对象,这远未达实用。在本工作中,我们研究真实世界中实体级文本引导图像操控(eL-TGIM)这一新任务。该任务提出三项基本要求:(1)编辑与文本描述一致的实体,(2)保留与实体无关的区域,(3)将操控后的实体自然融合进图像。为此,我们提出一个优雅的框架,称为SeMani,即真实世界图像的语义操控(Semantic Manipulation),其不仅能编辑实体外观,还能生成对应于文本引导的新实体。为解决eL-TGIM,SeMani将任务解耦为两个阶段:语义对齐阶段与图像操控阶段。在语义对齐阶段,SeMani引入语义对齐模块以定位待操控的实体相关区域。在图像操控阶段,SeMani采用生成模型,以实体无关区域和目标文本描述为条件合成新图像。我们讨论并提出了两种可用于SeMani的流行生成过程:基于transformers的离散自回归生成与基于扩散模型的连续去噪生成,分别得到SeMani-Trans与SeMani-Diff。我们在真实数据集CUB、Oxford和COCO上进行了大量实验,验证SeMani能区分实体相关与无关区域,并以零样本方式实现比基线方法更精确灵活的操控。我们的代码与模型将发布于https://github.com/Yikai-Wang/SeMani。

关键词

引用

@article{arxiv.2302.11383,
  title  = {Entity-Level Text-Guided Image Manipulation},
  author = {Yikai Wang and Jianan Wang and Guansong Lu and Hang Xu and Zhenguo Li and Wei Zhang and Yanwei Fu},
  journal= {arXiv preprint arXiv:2302.11383},
  year   = {2023}
}

备注

Extension of our CVPR 2022 oral paper: 2204.04428. Yikai Wang and Jianan Wang contribute equally. The arxiv version uses small size figures for fast preview, the full size pdf version can be found in our project page: https://yikai-wang.github.io/semani/. arXiv admin note: substantial text overlap with arXiv:2204.04428