中文

Auto DragGAN:在自回归方式下编辑生成图像流形

计算机视觉与模式识别 2024-07-29 v1

摘要

像素级精细图像编辑仍是一个开放挑战。以往方法未能在控制粒度和推理速度之间实现理想的平衡,要么未实现像素级精细控制,要么推理速度需要优化。为此,本文首次采用回归网络学习StyleGAN潜在代码在图像拖拽过程中的变化模式。该方法实现了在几乎无需时间代价下进行像素级精确拖拽编辑。用户可以在任何GAN生成的图像上指定控制点及其对应的目标点,我们的方法会将每个控制点移动到其对应的目标点。通过实验分析,我们发现,从控制点到目标点的短距离移动可产生高保真度的编辑图像,因为模型只需要预测一小部分像素的运动。为此,我们将整个运动过程分解为多个子过程。具体而言,我们开发了一个基于Transformer编码器-解码器的网络,命名为'Latent Predictor',以自回归方式预测从控制点到目标点的潜在代码运动轨迹。此外,为增强预测稳定性,我们引入了一个组件,称为'Latent Regularizer',用于约束潜在代码的运动位于自然图像的分布范围内。广泛的实验表明,我们的方法在像素级粒度上实现了最先进(SOTA)的推理速度和图像编辑性能。

关键词

引用

@article{arxiv.2407.18656,
  title  = {Auto DragGAN: Editing the Generative Image Manifold in an Autoregressive Manner},
  author = {Pengxiang Cai and Zhiwei Liu and Guibo Zhu and Yunfang Niu and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2407.18656},
  year   = {2024}
}

备注

This paper has been accepted as a poster paper for ACM Multimedia 2024