Draw-In-Mind: 重平衡统一多模态模型中设计师-画家角色以提升图像编辑能力
计算机视觉与模式识别
2026-04-09 v4 人工智能
摘要
近年来,将多模态理解与生成集成到单个统一模型的范式涌现为一种有前景的趋势。虽然这种方法在文本到图像(T2I)生成中取得了强大的成绩,但在精确图像编辑方面仍存在挑战。我们将这一局限归因于职责分配的不平衡。理解模块主要作为翻译者,将用户指令编码为语义条件;而生成模块必须同时充当设计者和画家,推断原始布局、识别目标编辑区域并渲染新内容。这种不平衡是反直觉的,因为理解模块通常在复杂推理任务上拥有更多数据进行训练,而生成模块相对不足。为解决此问题,我们引入 Draw-In-Mind(DIM),一个包含两个互补子集的数据集:(i) DIM-T2I,包含 1400 万长上下文图像-文本对,以增强复杂指令理解;(ii) DIM-Edit,包含由 GPT-4o 生成的 23.3 万条链式思维想象,作为图像编辑的显式设计蓝图。我们将冻结的 Qwen2.5-VL-3B 与可训练的 SANA1.5-1.6B 通过轻量级两层 MLP 连接,在提出的 DIM 数据集上进行训练,得到 DIM-4.6B-T2I/Edit。尽管参数规模适中,DIM-4.6B-Edit 在 ImgEdit 和 GEdit-Bench 上实现了 SOTA 或相当于 UniWorld-V1 和 Step1X-Edit 的性能。这些发现表明,将设计职责明确分配给理解模块对于图像编辑具有显著的益处。我们的数据集和模型已在 https://github.com/showlab/DIM 上提供。
引用
@article{arxiv.2509.01986,
title = {Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing},
author = {Ziyun Zeng and David Junhao Zhang and Wei Li and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2509.01986},
year = {2026}
}
备注
ICLR 2026 Camera Ready Version; Add more discussions and fix typos