中文

RefineStyle:用于 StyleGAN 的动态卷积精炼

计算机视觉与模式识别 2024-10-10 v1

摘要

在 StyleGAN 中,卷积核由静态参数(跨图像共享)和每个图像特定的动态调制因子 w+W+w^+\in\mathcal{W}^+ 共同决定。因此,W+\mathcal{W}^+ 空间常用于图像反向投影与编辑。然而,预训练模型因 W+\mathcal{W}^+ 及其结果卷积核的局限能力,难以合成域外图像,需通过复杂的超网络进行全部分或适应。本文提出一种高效的动态卷积精炼策略。核心思想是通过来自输入图像或域指导学习的低秩残差来修改卷积核。这些残差由两个令牌集之间矩阵乘法生成,两个令牌集数量相同,从而控制复杂度。我们在图像反向投影和域适应任务中验证了该精炼方案。在前者任务中,我们设计分组 Transformer 块通过单阶段或双阶段训练学习这些令牌集。在后者任务中,令牌集直接优化以支持目标域的合成,同时保持原始内容。广泛实验表明,我们的方法在图像反向投影方面实现低失真,在域外编辑质量方面表现优异。

关键词

引用

@article{arxiv.2410.06104,
  title  = {RefineStyle: Dynamic Convolution Refinement for StyleGAN},
  author = {Siwei Xia and Xueqi Hu and Li Sun and Qingli Li},
  journal= {arXiv preprint arXiv:2410.06104},
  year   = {2024}
}

备注

Accepted by PRCV2024