CoGS:基于草图与风格的可控生成与检索
计算机视觉与模式识别
2022-07-21 v2
摘要
我们提出 CoGS,一种用于风格条件化、草图驱动的图像合成新方法。CoGS 能够对给定草图对象的多种外观可能进行探索,实现对输出结构与外观的解耦控制。通过输入草图与作为示例的“风格”条件图像,送入基于 transformer 的草图与风格编码器生成离散码本表示,实现对物体结构与外观的粗粒度控制。我们将码本表示映射至度量空间,从而在通过向量量化 GAN(VQGAN)解码器生成图像前,对多个合成选项的选择与插值实现细粒度控制。因此,我们的框架统一了检索与合成任务:草图与风格对可用于执行初始合成,并可通过与检索语料库中相似结果结合来精炼,以生成更贴合用户意图的图像。我们表明,在新建的 Pseudosketches 数据集的 125 个对象类上训练的模型,能够生成丰富语义内容与外观风格。
引用
@article{arxiv.2203.09554,
title = {CoGS: Controllable Generation and Search from Sketch and Style},
author = {Cusuh Ham and Gemma Canet Tarres and Tu Bui and James Hays and Zhe Lin and John Collomosse},
journal= {arXiv preprint arXiv:2203.09554},
year = {2022}
}