ManiTrans:基于逐 token 语义对齐与生成的实体级文本引导图像编辑
计算机视觉与模式识别
2022-04-12 v1
摘要
现有的文本引导图像编辑方法旨在修改图像外观或在虚拟或简单场景中编辑少量物体,远未达实用要求。本文研究真实世界中实体级文本引导图像编辑这一新任务。该任务提出三项基本要求:(1) 编辑与文本描述一致的实体,(2) 保留与文本无关的区域,(3) 将编辑后的实体自然融合进图像。为此,我们提出一种基于两阶段图像合成方法的新型 transformer 框架,即 \textbf{ManiTrans},其不仅能编辑实体外观,还能生成对应文本引导的新实体。我们的框架引入语义对齐模块以定位待编辑图像区域,并采用语义损失帮助对齐视觉与语言间的关系。我们在真实数据集 CUB、Oxford 和 COCO 上进行了大量实验,验证相较基线方法,我们的方法能区分相关与无关区域,实现更精确灵活的编辑。项目主页为 \url{https://jawang19.github.io/manitrans}。
引用
@article{arxiv.2204.04428,
title = {ManiTrans: Entity-Level Text-Guided Image Manipulation via Token-wise Semantic Alignment and Generation},
author = {Jianan Wang and Guansong Lu and Hang Xu and Zhenguo Li and Chunjing Xu and Yanwei Fu},
journal= {arXiv preprint arXiv:2204.04428},
year = {2022}
}
备注
Accepted by CVPR2022 (Oral)