舞台搭建:文本驱动的场景一致图像生成
计算机视觉与模式识别
2026-05-19 v3
摘要
我们聚焦于场景搭建这一基础性任务:给定参考场景图像和指定要生成的演员类别及其与场景的空间关系文本条件,以生成保持相同场景身份的输出图像,同时正确地根据文本中描述的空间关系生成演员。现有方法在此任务上难以胜任,主要由于高质量配对数据的稀缺以及生成目标的非约束性。为克服数据瓶颈,我们提出了一种新型数据构建管道,融合真实世界摄影作品、实体移除和图像到视频扩散模型,以生成多样化场景、视点及正确实体-场景关系的训练对。此外,我们引入了新的对应引导注意力损失,利用跨视图线索强制空间对齐参考场景。在我们的场景一致基准上的实验表明,我们的方法在自动指标和人类偏好研究中实现了更好的场景对齐和文本-图像对齐。本方法能够生成多样化视点和构图,同时忠实地遵循文本指令并保留参考场景身份。
引用
@article{arxiv.2512.12598,
title = {Setting the Stage: Text-Driven Scene-Consistent Image Generation},
author = {Cong Xie and Che Wang and Yan Zhang and Ruiqi Yu and Han Zou and Zheng Pan and Zhenpeng Zhan},
journal= {arXiv preprint arXiv:2512.12598},
year = {2026}
}