PISCO:基于稀疏控制的精准视频实例插入
计算机视觉与模式识别
2026-03-30 v2 人工智能
摘要
AI 视频生成的格局正在发生关键性转变:从依赖详尽提示工程和“挑选”的通用生成,转向细粒度、可控生成及高保真后处理。在专业 AI 辅助电影制作中,执行精准、有针对性的修改至关重要。其核心任务之一是视频实例插入,即需在保持场景完整性的前提下将特定实例插入现有画面。不同于传统视频编辑,此任务要求实现:精准的时空定位、物理一致的场景交互以及忠实保留原始动态,同时需在最小化用户 effort 的前提下完成。本文提出 PISCO,一种用于精准视频实例插入的视频扩散模型,支持任意稀疏关键帧控制。PISCO 允许用户指定单个关键帧、起始-结束关键帧,或任意时间戳的稀疏关键帧,自动传播物体外观、运动及交互。为解决稀疏条件在预训练视频扩散模型中引起的严重分布偏移,我们引入 Variable-Information Guidance 以实现稳健条件化,结合 Distribution-Preserving Temporal Masking 以稳定时序生成,并通过几何感知条件化实现真实场景适配。我们进一步构建了 PISCO-Bench,一个包含经验证的实例标注及配对干净背景视频的数据集,并采用参考式与非参考式感知指标进行评估。实验表明,PISCO 在稀疏控制下均显著优于强大的图像填充和视频编辑基线方法,且随控制信号数量增加表现呈现清晰、单调的改进。项目页面:xiangbogaobarry.github.io/PISCO。
引用
@article{arxiv.2602.08277,
title = {PISCO: Precise Video Instance Insertion with Sparse Control},
author = {Xiangbo Gao and Renjie Li and Xinghao Chen and Yuheng Wu and Suofei Feng and Qing Yin and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2602.08277},
year = {2026}
}