EditAR:基于自回归模型的统一条件生成
计算机视觉与模式识别
2025-01-09 v1
摘要
可控图像生成与编辑的最新进展主要受益于基于扩散的方法。尽管扩散模型在特定任务上通过定制化设计表现卓越,但建立统一模型仍具挑战。相比之下,自回归模型天然具备统一的分词表示,这简化了为各种任务创建单个基础模型的过程。本文提出 EditAR,一个用于各种条件图像生成任务的单一统一自回归框架,包括图像编辑、深度图到图像、边缘到图像、分割到图像等。该模型同时接受图像和指令作为输入,以标准的下一个标记范式预测编辑后的图像标记。为增强文本到图像对齐,我们进一步提出将基础模型的知识蒸馏到自回归建模过程中。我们在建立基准测试上的 diverse 任务上评估了其有效性,表现与各种最先进的任务特定方法相当。项目页面:https://jitengmu.github.io/EditAR/
引用
@article{arxiv.2501.04699,
title = {EditAR: Unified Conditional Generation with Autoregressive Models},
author = {Jiteng Mu and Nuno Vasconcelos and Xiaolong Wang},
journal= {arXiv preprint arXiv:2501.04699},
year = {2025}
}
备注
Project page: https://jitengmu.github.io/EditAR/