MakeAnything:利用扩散 Transformer 进行多领域程序化序列生成
计算机视觉与模式识别
2025-02-06 v2
摘要
人类智能的一个标志是能够通过结构化的多步骤过程创造复杂的制品。利用人工智能生成程序化教程是一个长期存在但具有挑战性的目标,面临三个关键障碍:(1) 多任务程序化数据集的稀缺,(2) 在步骤之间保持逻辑连续性和视觉一致性,以及 (3) 跨多个领域进行泛化。为了应对这些挑战,我们提出了一个涵盖 21 个任务、包含超过 24,000 个程序化序列的多领域数据集。在此基础上,我们引入了 MakeAnything,这是一个基于扩散 Transformer (Diffusion Transformer, DIT) 的框架,它利用微调来激活 DIT 的上下文能力,以生成一致的程序化序列。我们引入了用于图像生成的非对称低秩适应 (Low-Rank Adaptation, LoRA),通过冻结编码器参数同时自适应地调整解码器层,来平衡泛化能力和任务特定性能。此外,我们的 ReCraft 模型通过时空一致性约束实现了图像到过程的生成,允许将静态图像分解为合理的创建序列。大量实验表明,MakeAnything 超越了现有方法,为程序化生成任务设定了新的性能基准。
引用
@article{arxiv.2502.01572,
title = {MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation},
author = {Yiren Song and Cheng Liu and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2502.01572},
year = {2025}
}