中文

基于离散噪声反向的下一尺度自回归文本驱动图像编辑

计算机视觉与模式识别 2025-09-04 v2

摘要

视觉自回归模型(VAR)最近涌现为一种有前景的生成模型类,在文本到图像生成任务中实现了与扩散模型相当的性能。虽然条件生成已被广泛探索,但进行无需额外训练的提示导向图像编辑能力同样关键,因为它支持众多实际应用场景。本文通过引入 Visual AutoRegressive Inverse Noise(VARIN),即首个专为 VAR 模型设计的噪声反向编辑技术,来探讨 VAR 的文本到图像编辑能力。VARIN 利用一种新颖的伪逆函数进行 argmax 抽样,称为 Location-aware Argmax Inversion(LAI),以生成逆 Gumbel 噪声。这些逆噪声使我们能够精确重建源图像,并促进与文本提示一致的目标化编辑。广泛的实验表明,VARIN 有效地根据指定提示修改源图像,同时显著保留原始背景和结构细节,从而验证了其作为实用编辑方法的有效性。

关键词

引用

@article{arxiv.2509.01984,
  title  = {Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing},
  author = {Quan Dao and Xiaoxiao He and Ligong Han and Ngan Hoai Nguyen and Amin Heyrani Nobar and Faez Ahmed and Han Zhang and Viet Anh Nguyen and Dimitris Metaxas},
  journal= {arXiv preprint arXiv:2509.01984},
  year   = {2025}
}

备注

update affiliation