组合人物:多人交互场景的迭代姿态-图像生成
计算机视觉与模式识别
2026-05-25 v1
摘要
尽管近期取得了进展,文本到图像模型仍然难以生成语义多样且构图准确的多人交互场景,常常坍缩为重复的布局、刻板的姿态以及缺乏依托的交互。在本工作中,我们通过引入双重姿态-图像表示,将以人为中心的结构先验引入到预训练的扩散转换器中。我们的模型联合预测二维姿态可视化图像及其对应的RGB图像,使结构与外观在学习过程中同步演化。其核心是一种跨模态对齐方案,将文本、姿态和图像表示绑定在一起,确保跨模态的一致对齐。此外,我们设计了迭代场景构建方案,逐步生成复杂的多人人类交互,有效分解整体生成的复杂性。广泛的实验表明,我们的方法在多人图像生成中显著提高了提示词对齐度和场景多样性。
引用
@article{arxiv.2605.23178,
title = {Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes},
author = {Wenxuan Peng and Bharath Hariharan and Hadar Averbuch-Elor},
journal= {arXiv preprint arXiv:2605.23178},
year = {2026}
}
备注
Accepted to SIGGRAPH Conference Papers 2026. 22 pages, 12 figures. Project page: https://cornell-vailab.github.io/PeopleComposer/