SIGMA-GEN:基于结构与身份导向的多主体图像生成
计算机视觉与模式识别
2025-10-09 v1
摘要
我们提出了 SIGMA-GEN,一个用于多身份保持图像生成的统一框架。不同于先前方法, SIGMA-GEN 是首个能够通过结构和空间约束实现单次多主体身份保持生成的模型。我们方法的一个关键优势是支持用户在不同精度水平进行指导——从粗糙的 2D 或 3D 边界框到像素级分段和深度——仅用一个模型。为实现这一点,我们引入了 SIGMA-SET27K,一个新型合成数据集,为 27k 张图像中的 10 万多个独特主体提供身份、结构和空间信息。通过广泛的评估我们展示了 SIGMA-GEN 在身份保持、图像生成质量和速度方面实现了最先进的性能。代码和可视化效果请参见 https://oindrilasaha.github.io/SIGMA-Gen/
引用
@article{arxiv.2510.06469,
title = {SIGMA-GEN: Structure and Identity Guided Multi-subject Assembly for Image Generation},
author = {Oindrila Saha and Vojtech Krs and Radomir Mech and Subhransu Maji and Kevin Blackburn-Matzen and Matheus Gadelha},
journal= {arXiv preprint arXiv:2510.06469},
year = {2025}
}
备注
Webpage: https://oindrilasaha.github.io/SIGMA-Gen/