三模版提示:场景、主体与运动统一控制的视频扩散
计算机视觉与模式识别
2026-03-17 v1
摘要
近期的视频扩散模型在视觉质量方面取得了显著进展,但精确、细粒度的控制仍是限制实际自定义化用于内容创建的关键瓶颈。对于AI视频创作者而言,三种形式的控制至关重要:(i) 场景构图,(ii) 多视角一致的主体定制,以及(iii) 摄像机姿态或物体运动调整。现有方法通常以孤立方式处理这些维度,对多视角主体合成和在任意姿态变化下保持身份识别支持有限。缺乏统一架构使得支持灵活、联合可控的视频变得困难。我们提出Tri-Prompting,一个统一框架和两阶段训练范式,将场景构图、多视角主体一致性和运动控制集成。我们的方法利用由3D跟踪点驱动的背景场景和降采样RGB线索驱动的前景主体的双条件运动模块。为确保可控性与视觉真实性之间的平衡,我们进一步提出了推理阶段的ControlNet比例计划。Tri-Prompting支持新工作流程,包括将3D感知的主体插入任何场景以及操作现有主体。实验结果表明,Tri-Prompting在多视角主体身份、3D一致性和运动精度方面显著优于如Phantom和DaS等专业基线方法。
引用
@article{arxiv.2603.15614,
title = {Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion},
author = {Zhenghong Zhou and Xiaohang Zhan and Zhiqin Chen and Soo Ye Kim and Nanxuan Zhao and Haitian Zheng and Qing Liu and He Zhang and Zhe Lin and Yuqian Zhou and Jiebo Luo},
journal= {arXiv preprint arXiv:2603.15614},
year = {2026}
}
备注
Project page: https://zhouzhenghong-gt.github.io/Tri-Prompting-Page/