ChatDiT:基于扩散 Transformer 进行任务无关自由形式聊天的免训练基线
摘要
最近的研究 arXiv:2410.15027 arXiv:2410.23775 强调了预训练扩散 Transformer (DiTs) 固有的上下文生成能力,使其能够以最小或无需架构修改无缝适应各种视觉任务。这些能力通过跨多张输入和目标图像拼接自注意力 token,并结合分组和掩码生成流水线来解锁。在此基础之上,我们提出了 ChatDiT,这是一个零样本、通用且交互式的视觉生成框架,该框架以原始形式利用预训练扩散 Transformer,无需额外的微调、适配器或修改。用户可以通过一轮或多轮对话中的自由形式自然语言与 ChatDiT 交互,创建图文交错的文章、多页图画书、编辑图像、设计 IP 衍生品或开发角色设计设置。ChatDiT 的核心是一个由三个关键组件组成的多智能体系统:一个用于解析用户上传图像和指令的指令解析智能体,一个用于制定单步或多步生成动作的策略规划智能体,以及一个使用扩散 Transformer 上下文工具包执行这些动作的执行智能体。我们在 IDEA-Bench arXiv:2412.11767 上对 ChatDiT 进行了全面评估,该基准包含 100 个真实世界设计任务和 275 个具有不同指令以及不同数量输入和目标图像的案例。尽管简单且采用免训练方法,ChatDiT 超越了所有竞争对手,包括那些专门在广泛的多任务数据集上设计和训练的模型。我们进一步指出了预训练 DiTs 在零样本适应任务时的关键局限性。我们发布了所有代码、智能体、结果和中间输出,以促进进一步的研究:https://github.com/ali-vilab/ChatDiT
引用
@article{arxiv.2412.12571,
title = {ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers},
author = {Lianghua Huang and Wei Wang and Zhi-Fan Wu and Yupeng Shi and Chen Liang and Tong Shen and Han Zhang and Huanzhang Dou and Yu Liu and Jingren Zhou},
journal= {arXiv preprint arXiv:2412.12571},
year = {2024}
}
备注
Tech report. Project page: https://ali-vilab.github.io/ChatDiT-Page/