中文

在StyleGAN中学习文本引导的与输入无关操控方向

计算机视觉与模式识别 2023-02-28 v1

摘要

凭借快速推理和人性化灵活操控的优势,通过文本引导的图像无关风格操控实现了以往无法获得的新应用。最先进的文本引导图像无关操控方法在对比语言-图像预训练(CLIP)空间中独立嵌入StyleGAN每个通道的表示,并以字典形式提供,以便在推理时快速找出通道级操控方向。然而,本文中我们认为这种通过单独控制单通道构建的字典难以容纳文本引导的多样性,因为未考虑多通道间的集体与交互关系。事实上,我们表明其未能发现现有方法(无需文本手动操控潜空间)可找到的绝大部分操控方向。为缓解此问题,我们提出一种新方法,通过学习一个字典(其条目对应单通道的表示),同时考虑来自与其他多通道交互产生的操控效应。我们证明该策略解决了先前方法在从无监督方法发现多样已知方向及从随机文本发现未知方向上的不足,同时保持实时推理速度与解耦能力。

关键词

引用

@article{arxiv.2302.13331,
  title  = {Learning Input-agnostic Manipulation Directions in StyleGAN with Text Guidance},
  author = {Yoonjeon Kim and Hyunsu Kim and Junho Kim and Yunjey Choi and Eunho Yang},
  journal= {arXiv preprint arXiv:2302.13331},
  year   = {2023}
}

备注

Accepted to ICLR 2023