GenHSI:可控的人-场景交互视频生成
计算机视觉与模式识别
2026-04-20 v2
摘要
大规模预训练视频扩散模型在多样化的视频生成任务中展现出惊人的能力。然而,现有方法在生成富有丰富人-场景交互(HSI)的长视频时面临若干挑战,包括动态不真实、交互不合理、缺乏主体身份保持,以及需要高昂训练成本等问题。为此,我们提出了 GenHSI,一种用于可控生成长时段HSI视频的训练-free 方法,具备3D感知能力。着手于电影动画学,我们将视频合成细分为三个阶段:(1)剧本书写、(2)预可视化、(3)动画。给定场景图像和带用户描述的字符,我们利用这三个阶段生成保持人类身份并提供丰富且合理HSI的长视频。剧本书写将涉及HSI链的复杂文本提示转换为用于预可视化阶段的简单原子动作,以生成3D关键帧。为合成3D关键帧中合理的人类交互姿态,我们利用预训练的2D inpainting 扩散模型基于视图标准化生成合理的2D人类交互,从而消除以往工作中多视图拟合的需求。我们随后通过稳健的迭代优化将这些交互扩展到3D,依据接触线索和来自视觉语言模型的推理。以这些3D关键帧为提示,预训练的视频扩散模型能够更好地以3D感知方式生成一致的长视频,具有合理的动态特性和交互感。我们是首个基于场景和角色图像参考而无需训练即可生成HSI动作链的长视频序列。实验表明,我们的方法能够生成有效保留场景内容和角色身份、并提供合理人-场景交互的HSI视频。
引用
@article{arxiv.2506.19840,
title = {GenHSI: Controllable Generation of Human-Scene Interaction Videos},
author = {Zekun Li and Rui Zhou and Rahul Sajnani and Xiaoyan Cong and Daniel Ritchie and Srinath Sridhar},
journal= {arXiv preprint arXiv:2506.19840},
year = {2026}
}