ReImagine:通过图像优先合成重新思考可控的高质量人类视频生成
计算机视觉与模式识别
2026-04-22 v1
摘要
由于在有限的多视角数据下联合建模人类外观、运动和相机视角的困难,人类视频生成仍然具有挑战性。现有方法通常分别处理这些因素,导致可控性有限或视觉质量下降。我们从图像优先的视角重新审视这一问题,其中高质量的人类外观通过图像生成来学习,并作为视频合成的先验,从而将外观建模与时间一致性解耦。我们提出了一种姿态和视角可控的流水线,将预训练的图像主干与基于 SMPL-X 的运动引导相结合,并辅以基于预训练视频扩散模型的免训练时间细化阶段。我们的方法在多样的姿态和视角下产生了高质量、时间一致的视频。我们还发布了规范人类数据集和用于组合式人类图像合成的辅助模型。代码和数据公开于 https://github.com/Taited/ReImagine。
引用
@article{arxiv.2604.19720,
title = {ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis},
author = {Zhengwentai Sun and Keru Zheng and Chenghong Li and Hongjie Liao and Xihe Yang and Heyuan Li and Yihao Zhi and Shuliang Ning and Shuguang Cui and Xiaoguang Han},
journal= {arXiv preprint arXiv:2604.19720},
year = {2026}
}