中文

InstanceV:基于实例的视频生成

计算机视觉与模式识别 2025-12-01 v1

摘要

最近的文本到视频扩散模型研究进展使能够生成以文本描述为条件的高质量视频。然而,大多数现有的文本到视频模型仅依赖文本条件,缺乏对视频生成的一般性细粒度控制。为解决这一挑战,我们提出了 InstanceV,一种实现 i) 实例级控制和 ii) 全局语义一致性的视频生成框架。具体而言,借助提出的实例感知掩码交叉注意力机制,InstanceV 最大化利用额外的实例级 grounding 信息,在指定空间位置生成正确归属的实例。为提高整体一致性,我们引入共享时间步自适应提示增强模块,该模块以参数高效的方式将局部实例与全局语义相连。此外,我们在训练和推理期间采用空间感知无条件引导,以缓解小实例消失的问题。最后,我们提出了一个新的基准,称为 InstanceBench,该基准将通用视频质量指标与实例感知指标结合,用于更全面地评估实例级视频生成。大量实验表明,InstanceV 不仅在视频生成中实现了显著的实例级可控性,而且在定性和定量评估中在一般质量和实例感知指标上超越了现有的领先模型。

关键词

引用

@article{arxiv.2511.23146,
  title  = {InstanceV: Instance-Level Video Generation},
  author = {Yuheng Chen and Teng Hu and Jiangning Zhang and Zhucun Xue and Ran Yi and Lizhuang Ma},
  journal= {arXiv preprint arXiv:2511.23146},
  year   = {2025}
}