OmniTransfer:用于时空视频转换的全能框架
计算机视觉与模式识别
2026-01-21 v1
摘要
视频比图像或文本更丰富,捕捉空间和时间动态。然而,大多数现有视频定制方法依赖参考图像或任务特定的时序先验,无法充分利用视频固有的时空信息,从而限制了视频生成的灵活性和通用性。为此,我们提出OmniTransfer,一个用于时空视频转换的统一框架。它利用跨帧的多视图信息来增强外观一致性,利用时序线索来实现细粒度时序控制。为了统一各种视频转换任务,OmniTransfer包含三个关键设计:任务感知位置偏差通过适应性地利用参考视频信息来提高时序对齐或外观一致性;参考解耦因果学习分离参考和目标分支以实现精确的参考转换同时提高效率;任务自适应多模态对齐使用多模态语义指导动态区分和处理不同任务。广泛的实验表明,OmniTransfer在外观(ID和风格)和时序转换(相机运动和视频特效)方面优于现有方法,而在不使用姿态的情况下在运动转换中与姿态引导方法持平,确立了一个灵活、高保真视频生成的新范式。
引用
@article{arxiv.2601.14250,
title = {OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer},
author = {Pengze Zhang and Yanze Wu and Mengtian Li and Xu Bai and Songtao Zhao and Fulong Ye and Chong Mou and Xinghui Li and Zhuowei Chen and Qian He and Mingyuan Gao},
journal= {arXiv preprint arXiv:2601.14250},
year = {2026}
}
备注
Github Page: https://pangzecheung.github.io/OmniTransfer/