FICE:基于引导式 GAN 反演的文本条件时尚图像编辑
计算机视觉与模式识别
2023-01-06 v1 人工智能
机器学习
摘要
时尚图像编辑是一项具有挑战性的计算机视觉任务,其目标是将所选服装融入给定输入图像中。大多数现有技术(称为虚拟试穿方法)通过首先选择所需服装的示例图像,然后将衣物转移到目标人物来处理该任务。相反,本文考虑利用文本描述编辑时尚图像。这种方法相较于基于示例的虚拟试穿技术具有若干优势,例如:(i) 不需要目标时尚物品的图片;(ii) 可通过自然语言表述多种视觉概念。现有的处理语言输入的图像编辑方法严重受限于其对带有丰富属性标注训练集的需求,或仅能处理简单文本描述。我们通过提出一种称为 FICE(Fashion Image CLIP Editing,时尚图像 CLIP 编辑)的新型文本条件编辑模型来解决这些限制,该模型能处理多种不同的文本描述以引导编辑过程。具体而言,在 FICE 中,我们在生成图像时通过加入语义、姿态相关及图像级约束来扩充常见的 GAN 反演过程。由于 CLIP 模型卓越的图像-文本关联能力,我们利用其来强化语义。此外,我们提出一种潜码正则化技术,以更好地控制合成图像的保真度。我们在 VITON 图像与 Fashion-Gen 文本描述的组合上,并与若干最先进的文本条件图像编辑方法比较,通过严谨实验验证了 FICE。实验结果表明,FICE 生成高度逼真的时尚图像,并取得优于现有竞争方法的更强编辑性能。
引用
@article{arxiv.2301.02110,
title = {FICE: Text-Conditioned Fashion Image Editing With Guided GAN Inversion},
author = {Martin Pernuš and Clinton Fookes and Vitomir Štruc and Simon Dobrišek},
journal= {arXiv preprint arXiv:2301.02110},
year = {2023}
}