中文

Scone:通过统一理解-生成建模桥接构图与区分于受主导的图像生成

计算机视觉与模式识别 2026-04-14 v2 人工智能

摘要

受主导的图像生成从单主体发展到多主体构图,却忽视了区分能力——即在输入包含多个候选主体时正确区分和生成的能力。此限制限制了在复杂真实视觉场景中的效果。我们提出 Scone,一种集成构图与区分的统一理解-生成方法。Scone 使理解专家作为语义桥梁发挥作用,将语义信息传递给生成专家,以在最小化干扰的同时保持主体身份。我们引入一个两阶段训练方案,首先学习构图,然后通过语义对齐和基于注意力的掩码来增强区分。我们还引入 SconeEval,用于评估构图和区分在各种场景中的表现。实验表明,Scone 在两个基准数据集上的构图和区分任务中超越了现有开源模型。我们的模型、基准和训练数据均可用于:https://github.com/Ryann-Ran/Scone。

关键词

引用

@article{arxiv.2512.12675,
  title  = {Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling},
  author = {Yuran Wang and Bohan Zeng and Chengzhuo Tong and Wenxuan Liu and Yang Shi and Xiaochen Ma and Hao Liang and Yuanxing Zhang and Wentao Zhang},
  journal= {arXiv preprint arXiv:2512.12675},
  year   = {2026}
}

备注

Code: https://github.com/Ryann-Ran/Scone