FreeViS:基于不一致参考资料的无训练视频风格化
计算机视觉与模式识别
2025-10-03 v1
摘要
视频风格化是内容创建中的关键环节,但仍是一个具有挑战性的问题。直接逐帧应用图像风格化会损害时间一致性并降低风格丰富性。或者,训练专门的视频风格化模型通常需要配对视频数据且计算成本高昂。本文我们提出了FreeViS,一个无训练视频风格化框架,可生成具有丰富风格细节和强时间一致性的风格化视频。该方法将多个风格化参考资料整合到预训练的图像到视频(I2V)模型中,有效缓解了以往work中观察到的传播误差,同时不会引入抖动和卡顿。此外,它利用高频补偿来约束内容布局和运动,结合基于流的运动线索来保留低注意区域的风格纹理。通过广泛的评估,FreeViS实现了更高的风格化保真度和卓越的时间一致性,超越了最近的基准并实现了强烈的人类偏好。我们的无训练管道为高质量、具有时间一致性的视频风格化提供了实用且经济的解决方案。代码和视频可在https://xujiacong.github.io/FreeViS/访问
引用
@article{arxiv.2510.01686,
title = {FreeViS: Training-free Video Stylization with Inconsistent References},
author = {Jiacong Xu and Yiqun Mei and Ke Zhang and Vishal M. Patel},
journal= {arXiv preprint arXiv:2510.01686},
year = {2025}
}
备注
Project Page: \url{https://xujiacong.github.io/FreeViS/}