ACE:通过扩散变换器实现全方位创作与编辑
计算机视觉与模式识别
2024-11-06 v2 人工智能
摘要
扩散模型已成为强大的生成技术,被发现适用于各种场景。大多数现有基础扩散模型主要为文本引导的视觉生成设计,不支持多模态条件,这对于许多视觉编辑任务至关重要。这一限制阻止了这些基础扩散模型作为视觉生成领域的统一模型(如GPT-4在自然语言处理领域)发挥作用。本文提出了ACE(All-round Creator and Editor),实现了在广泛的视觉生成任务中与专家模型相当的性能。为实现这一目标,我们首先引入一种统一的条件格式,称为Long-context Condition Unit (LCU),并提出一种新型基于Transformer的扩散模型,用LCU作为输入,旨在跨各种生成和编辑任务进行联合训练。此外,我们提出了一种高效的数据收集方法,以解决缺乏可用训练数据的问题。该方法涉及获取基于合成或聚类管道的成对图像,并通过利用微调的多模态大型语言模型提供准确的文本指令。为全面评估我们模型的性能,我们建立了一个跨各种视觉生成任务的人工标注配对数据基准。大量实验结果表明,我们模型在视觉生成领域的优越性。 thanks to our model的全能能力,我们可以轻松构建一个多模态聊天系统,该系统可响应任何关于图像创建的交互请求,使用单个模型作为后端,避免了视觉智能体中通常使用的繁琐管道。代码和模型将在项目页面提供:https://ali-vilab.github.io/ace-page/。
关键词
引用
@article{arxiv.2410.00086,
title = {ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer},
author = {Zhen Han and Zeyinzi Jiang and Yulin Pan and Jingfeng Zhang and Chaojie Mao and Chenwei Xie and Yu Liu and Jingren Zhou},
journal= {arXiv preprint arXiv:2410.00086},
year = {2024}
}