中文

视觉感知的链到思维:统一模型中的高保真视觉一致性

计算机视觉与模式识别 2025-12-23 v1

摘要

最近,链到思维(CoT)的引入大大提升了统一模型的生成能力。然而,观察到当前的思考过程主要关注文本提示下的文本一致性,忽略了在多模态生成期间(例如,多参考图像生成)与视觉参考图像的视觉上下文一致性。缺乏这种一致性导致无法保持关键视觉特征(如人体 ID、物体属性、风格)。为此,我们将视觉上下文一致性整合到统一模型的推理中,显式地通过 1)自适应视觉规划:生成结构化的视觉检查清单,以确定所需保持的视觉元素,以及 2)迭代视觉纠正:在检查清单指导下进行自我反思,并以迭代方式细化生成结果。为实现这一目标,我们使用监督微调教授模型如何进行视觉检查规划、自我反思和自我细化,并使用 flow-GRPO 通过自定义的视觉检查奖励进一步提升视觉一致性。实验表明,我们的方法在多模态生成中优于零-shot 统一模型和带文本 CoT 的模型,显示出更高的视觉上下文一致性。

关键词

引用

@article{arxiv.2512.19686,
  title  = {Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models},
  author = {Zixuan Ye and Quande Liu and Cong Wei and Yuanxing Zhang and Xintao Wang and Pengfei Wan and Kun Gai and Wenhan Luo},
  journal= {arXiv preprint arXiv:2512.19686},
  year   = {2025}
}

备注

Project Page: https://zixuan-ye.github.io/VACoT/