ContextGen:面向身份一致性多实例生成的情境布局锚定
计算机视觉与模式识别
2026-02-13 v3
摘要
多实例图像生成(Multi-Instance Generation, MIG)在现代扩散模型中由于难以实现对对象布局的精确控制以及保持多个不同主体身份一致性而面临重大挑战。为此,我们引入ContextGen,这是一种由布局和参考图像引导的多实例生成的新型扩散转换器框架。我们的ethods方法集成了两个关键技术贡献:一种情境布局锚定(Contextual Layout Anchoring, CLA)机制,将复合布局图像纳入生成上下文,以稳健地锚定对象在其期望位置;以及身份一致性注意力(Identity Consistency Attention, ICA),一种创新的注意力机制,利用情境参考图像确保多个实例的身份一致性。为解决缺乏大规模高质量数据集以支持此任务的限制,我们引入IMIG-100K,这是第一个为多实例生成提供详细布局和身份标注的数据集。广泛的实验表明,ContextGen取得了新的状态突破,尤其在布局控制和身份保真度方面优于现有方法。
引用
@article{arxiv.2510.11000,
title = {ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation},
author = {Ruihang Xu and Dewei Zhou and Fan Ma and Yi Yang},
journal= {arXiv preprint arXiv:2510.11000},
year = {2026}
}
备注
Project Page: https://nenhang.github.io/ContextGen/