面向多主体图像生成的层次概念-外观引导方法
计算机视觉与模式识别
2026-02-04 v1 人工智能
摘要
多主体图像生成旨在合成图像,同时忠实保留多个参考主体的身份信息,并遵循文本指令。然而,现有方法常因依赖扩散模型在文本提示与参考图像之间隐式关联,而导致身份不一致和构图控制受限。本文提出层次概念-外观引导框架(Hierarchical Concept-to-Appearance Guidance, CAG),提供从高层概念到细粒度外观的显式、结构化监督。在概念层面,我们引入 VAE dropout 训练策略,随机遗漏参考 VAE 特征,鼓励模型更多依赖来自视觉语言模型(VLM)的稳健语义信号,从而在缺乏完整外观线索时实现概念层面的一致生成。在外观层面,我们将 VLM 派生的对应关系集成到扩散 Transformer(DiT)中的对应感知掩码注意力模块中。该模块限制每个文本标记只能注意其匹配的参考区域,确保属性绑定精确且多主体构图可靠。大量实验表明,我们的方法在多主体图像生成任务上实现了最先进的性能,显著提升了提示跟随和主体一致性。
引用
@article{arxiv.2602.03448,
title = {Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation},
author = {Yijia Xu and Zihao Wang and Jinshi Cui},
journal= {arXiv preprint arXiv:2602.03448},
year = {2026}
}