一个模型编辑所有:基于语义调制的自由形式文本驱动图像操控
计算机视觉与模式识别
2022-10-18 v2
摘要
自由形式文本提示使用户能在图像操控中便捷地描述其意图。基于StyleGAN[21]的视觉潜空间与CLIP[34]的文本嵌入空间,研究聚焦于如何映射这两个潜空间以实现文本驱动的属性操控。目前,这两个空间之间的潜映射是凭经验设计的,且限制每个操控模型只能处理一个固定文本提示。在本文中,我们提出一种名为Free-Form CLIP(FFCLIP)的方法,旨在建立自动潜映射,使一个操控模型能处理自由形式文本提示。我们的FFCLIP具有一个跨模态语义调制模块,包含语义对齐与注入。语义对齐通过带交叉注意力机制的线性变换实现自动潜映射。对齐后,我们将文本提示嵌入的语义注入到StyleGAN潜空间。对于一类图像(如“人像”),可学习一个FFCLIP模型来处理自由形式文本提示。同时,我们观察到尽管每个训练文本提示仅含单一语义,FFCLIP可利用具多语义的文本提示进行图像操控。在实验中,我们在三类图像(即“人像”、“汽车”和“教堂”)上评估FFCLIP。视觉与数值结果均表明FFCLIP能有效生成语义准确且视觉逼真的图像。项目页面:https://github.com/KumapowerLIU/FFCLIP。
引用
@article{arxiv.2210.07883,
title = {One Model to Edit Them All: Free-Form Text-Driven Image Manipulation with Semantic Modulations},
author = {Yiming Zhu and Hongyu Liu and Yibing Song and ziyang Yuan and Xintong Han and Chun Yuan and Qifeng Chen and Jue Wang},
journal= {arXiv preprint arXiv:2210.07883},
year = {2022}
}
备注
Accepted by NeurIPS 2022