中文

BridgeIV:通过测试时自回归身份传递桥接定制图像与视频生成

计算机视觉与模式识别 2025-05-13 v1

摘要

零样态和调谐式定制文本到图像(CT2I)生成在故事创作中取得了显著进展。相比之下,定制文本到视频(CT2V)生成研究相对有限。现有的零样态 CT2V 方法存在泛化性差的问题,而另一类将调谐式 T2I 模型与时序运动模块直接组合往往导致结构和纹理信息的丢失。为填补这一差距,我们提出一种自回归结构和纹理传递模块(STPM),从参考主题中提取关键结构和纹理特征,并 autoregressively 注入每个视频帧以增强一致性。此外,我们引入一种测试时奖励优化(TTRO)方法进一步细化细节。定量和定性实验验证了 STPM 和 TTRO 的有效性,分别在 CLIP-I 和 DINO 一致性指标上相对于基线提升了 7.8 和 13.1。

关键词

引用

@article{arxiv.2505.06985,
  title  = {BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation},
  author = {Panwen Hu and Jiehui Huang and Qiang Sun and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2505.06985},
  year   = {2025}
}