PositionIC:用于图像定制的统一位置与身份一致性
计算机视觉与模式识别
2026-01-21 v6
摘要
近期的主体驱动图像定制在保真度方面表现出色,但细粒度的实例级空间控制仍是一个难以实现的挑战,限制了实际应用。这种限制源于两个因素:可扩展且带有位置标注的数据集的匮乏,以及由全局注意力机制导致的身份与布局的耦合。为此,我们提出PositionIC,一个用于高保真、可控多主体定制的统一框架。首先,我们提出BMPDS(the first automatic data-synthesis pipeline for position-annotated multi-subject datasets),为位置标注的多主体数据集提供自动数据合成管道,有效提供关键的空间监督。其次,我们设计一种轻量级、布局感知的扩散框架,集成一种新颖的可见性感知注意力机制。该机制通过类似NeRF的体积权重调节来显式建模空间关系,从而有效地将实例级空间嵌入与语义身份特征解耦,实现对多个主体的精确、遮挡感知的放置。大量实验表明,PositionIC在公开基准测试中实现了最先进的性能,在空间精度和身份一致性方面均取得了新的纪录。我们的工作代表了实现多实体场景下真正可控、高保真图像定制的重要一步。代码和数据:https://github.com/MeiGen-AI/PositionIC。
引用
@article{arxiv.2507.13861,
title = {PositionIC: Unified Position and Identity Consistency for Image Customization},
author = {Junjie Hu and Tianyang Han and Kai Ma and Jialin Gao and Song Yang and Xianhua He and Junfeng Luo and Xiaoming Wei and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2507.13861},
year = {2026}
}