扩展零样本参考视频生成
计算机视觉与模式识别
2025-12-09 v1
摘要
参考视频生成(R2V)旨在合成与文本提示对齐且保留参考图像中主体身份的视频。然而,现有 R2V 方法受限于对显式参考图像-视频-文本三元组的依赖,其构建成本高昂且难以扩展。我们通过引入 Saber 绕过这一瓶颈——一个无需显式 R2V 数据的可扩展零样本框架。Saber 仅基于视频-文本对进行训练,采用掩码训练策略和定制的基于注意力的模型设计来学习身份一致且参考感知的表征。此外,集成掩码增强技术以缓解参考视频生成中常见的复制粘贴伪影。 moreover,Saber 在不同数量的参考下展现出显著的泛化能力,并在 OpenS2V-Eval 基准上优于使用 R2V 数据训练的方法。
引用
@article{arxiv.2512.06905,
title = {Scaling Zero-Shot Reference-to-Video Generation},
author = {Zijian Zhou and Shikun Liu and Haozhe Liu and Haonan Qiu and Zhaochong An and Weiming Ren and Zhiheng Liu and Xiaoke Huang and Kam Woh Ng and Tian Xie and Xiao Han and Yuren Cong and Hang Li and Chuyan Zhu and Aditya Patel and Tao Xiang and Sen He},
journal= {arXiv preprint arXiv:2512.06905},
year = {2025}
}
备注
Website: https://franciszzj.github.io/Saber/