中文

VisionDirector:面向生成图像合成的视觉-语言引导闭环精炼

计算机视觉与模式识别 2026-02-06 v3

摘要

生成模型已能产生逼真的图像,但在专业设计师提出的长期、多目标提示下仍显得力不从心。为暴露这一差距并更好评估模型在实际场景中的表现,我们引入 Long Goal Bench(LGBench),一个包含 2000 项任务(1000 项 T2I 与 1000 项 I2I)的基准套件,其平均指令包含 18 至 22 个紧密耦合的目标,涵盖全局布局、局部物体放置、排版和标志保真度。我们发现,即使是最先进的模型也满足不到 72% 的目标,常常遗漏局部编辑,确认了当前管道的脆弱性。为此我们提出 VisionDirector,一个无训练的视觉-语言监督器(i)从长指令中提取结构化目标(ii)动态决定单次生成或分阶段编辑(iii)在每一次编辑后运行微网格采样进行语义验证和回滚(iv)记录目标级别的奖励。我们进一步通过组相对策优化(Group Relative Policy Optimization)对计划器进行微调,实现更短的编辑轨迹(3.1 步骤 vs 4.2 步骤)和更强的对齐。VisionDirector 在 GenEval 上取得全新状态的优势(提升 7%)并在 ImgEdit 上提升 0.07 的绝对值,同时在排版、多物体场景和姿态编辑上实现持久的定性改进。

关键词

引用

@article{arxiv.2512.19243,
  title  = {VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis},
  author = {Meng Chu and Senqiao Yang and Haoxuan Che and Suiyun Zhang and Xichen Zhang and Shaozuo Yu and Haokun Gui and Zhefan Rao and Dandan Tu and Rui Liu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2512.19243},
  year   = {2026}
}