NEP:基于下一编辑标记预测的自回归图像编辑
计算机视觉与模式识别
2025-10-14 v2
摘要
文本导向图像编辑通常基于语言指令修改源图像,仅影响小型局部区域。然而,现有方法生成整个目标图像而非仅选择性地重新生成计划编辑区域。这导致 (1) 不必要的计算成本和 (2) 对非编辑区域的重构偏差,妨碍了预期编辑质量。为解决这些限制,我们提出将图像编辑建模为基于自回归图像生成的下一编辑标记预测(NEP),其中仅重新生成需要编辑的区域,从而避免对非编辑区域的意外修改。为实现任意区域编辑,我们提出预训练任意顺序自回归文本到图像(T2I)模型。一旦训练完成,它能够零样本图像编辑,并可轻松适配 NEP 实现图像编辑,达到在广泛使用的图像编辑基准上实现最新 state-of-the-art。此外,我们的模型通过零样本方式迭代细化生成,自然支持测试时扩展(TTS)。项目页面为:https://nep-bigai.github.io/。
引用
@article{arxiv.2508.06044,
title = {NEP: Autoregressive Image Editing via Next Editing Token Prediction},
author = {Huimin Wu and Xiaojian Ma and Haozhe Zhao and Yanpeng Zhao and Qing Li},
journal= {arXiv preprint arXiv:2508.06044},
year = {2025}
}
备注
The project page is: https://nep-bigai.github.io/