中文

ACE++:基于指令的上下文感知内容填充图像生成与编辑

计算机视觉与模式识别 2025-01-16 v3

摘要

本文报告 ACE++,一个面向多种图像生成与编辑任务的基于指令的扩散框架。受 FLUX.1-Fill-dev 所提出的修复任务输入格式的启发,我们改进了 ACE 中引入的长上下文条件单元(LCU),并将此输入范式扩展至任意编辑与生成任务。为了充分利用图像生成先验,我们设计了一种两阶段训练方案,以最小化对 FLUX.1-dev 等强大文生图扩散模型微调的工作量。在第一阶段,我们使用来自文生图模型的 0-ref 任务数据对模型进行预训练。社区中存在许多基于文生图基础模型后训练(post-training)的模型,符合该第一阶段的训练范式。例如,FLUX.1-Fill-dev 主要处理绘画任务,可作为初始化以加速训练过程。在第二阶段,我们对上述模型进行微调,以支持 ACE 中定义的所有通用指令任务。为了推动 ACE++ 在不同场景中的广泛应用,我们提供了一套全面的模型,涵盖全量微调与轻量化微调,同时兼顾通用适用性与垂直场景适用性。定性分析表明,ACE++ 在图像生成质量与提示遵循能力方面具有显著优势。代码与模型将在项目页面发布:https://ali-vilab.github.io/ACE_plus_page/。

关键词

引用

@article{arxiv.2501.02487,
  title  = {ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling},
  author = {Chaojie Mao and Jingfeng Zhang and Yulin Pan and Zeyinzi Jiang and Zhen Han and Yu Liu and Jingren Zhou},
  journal= {arXiv preprint arXiv:2501.02487},
  year   = {2025}
}