中文

首帧即为去向:视频内容定制的首帧作用

计算机视觉与模式识别 2026-03-24 v2

摘要

视频生成模型的首帧援引何种作用?传统上,它被视为视频的空间时间起点,仅作为后续动画的种子。在本文中,我们从全新的视角揭示了这一观点:视频模型实际上将首帧隐式地视为概念记忆缓冲区,用于在生成过程中存储视觉实体以供后续重用。借助这一洞见,我们表明,仅需 20-50 个训练示例、无需架构修改或大规模微调,即可在多种场景下实现稳健且通用的视频内容定制。这揭示了视频生成模型一个被忽视且强大的能力,用于基于参考的视频定制。

关键词

引用

@article{arxiv.2511.15700,
  title  = {First Frame Is the Place to Go for Video Content Customization},
  author = {Jingxi Chen and Zongxia Li and Zhichao Liu and Guangyao Shi and Xiyang Wu and Fuxiao Liu and Cornelia Fermuller and Brandon Y. Feng and Yiannis Aloimonos},
  journal= {arXiv preprint arXiv:2511.15700},
  year   = {2026}
}

备注

Accepted to CVPR 2026