中文

AlcheMinT:面向多参考一致视频生成的细粒度时间控制

计算机视觉与模式识别 2025-12-12 v1 人工智能

摘要

近期利用大型扩散模型进行主体驱动视频生成的进展实现了个性化内容合成,其条件为用户提供的主体。然而,现有方法缺乏对主体外观出现与消失的细粒度时间控制,这对于组合视频合成、故事板绘制和可控动画等应用至关重要。我们提出了 AlcheMinT,一个引入显式时间戳条件用于主体驱动视频生成的统一框架。我们的方法引入了一种新颖的位置编码机制,用于编码时间区间,在我们的案例中与主体身份相关联,同时无缝集成到预训练视频生成模型的位置嵌入中。此外,我们结合了主体描述性文本 token,以加强视觉身份与视频字幕之间的绑定,从而减少生成过程中的歧义。通过逐 token 拼接,AlcheMinT 避免了任何额外的交叉注意力模块,并带来了可忽略的参数开销。我们建立了一个评估多个主体身份保持、视频保真度和时间一致性的基准。实验结果表明,AlcheMinT 在视觉质量上达到了最先进的视频个性化方法的水平,同时首次实现了对视频中多主体生成的精确时间控制。项目页面位于 https://snap-research.github.io/Video-AlcheMinT

关键词

引用

@article{arxiv.2512.10943,
  title  = {AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation},
  author = {Sharath Girish and Viacheslav Ivanov and Tsai-Shien Chen and Hao Chen and Aliaksandr Siarohin and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2512.10943},
  year   = {2025}
}

备注

Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT