StyleMaster:通过艺术生成与翻译为您的视频进行风格化
计算机视觉与模式识别
2024-12-11 v1
摘要
风格控制在视频生成模型中备受欢迎。现有方法常常生成的视频与给定风格相距甚远,导致内容泄漏,且难以将一个视频转化为所需的风格。我们首次观察到,风格提取阶段至关重要,而现有方法强调全局风格却忽略了局部纹理。为在保留风格纹理特征的同时防止内容泄漏,我们基于提示-图块相似性,对内容相关图块进行过滤以保留风格相关图块;对于全局风格提取,我们通过模型幻觉生成配对风格数据集以促进对比学习,显著增强了风格的绝对一致性。此外,为弥合图像到视频之间的差距,我们在静止视频上训练了一个轻量级运动适配器,隐式地增强了风格化程度,并使图像训练的模型能够无缝应用于视频。得益于这些努力,我们的方法StyleMaster不仅在风格相似性和时间一致性方面取得了显著提升,还能轻松地通过灰色砖块ControlNet实现视频风格迁移。大量实验和可视化结果表明,StyleMaster显著优于竞争方法,有效生成与文本内容相吻合且与参考图像风格高度一致的高质量风格化视频。我们的项目页面位于https://zixuan-ye.github.io/stylemaster
引用
@article{arxiv.2412.07744,
title = {StyleMaster: Stylize Your Video with Artistic Generation and Translation},
author = {Zixuan Ye and Huijuan Huang and Xintao Wang and Pengfei Wan and Di Zhang and Wenhan Luo},
journal= {arXiv preprint arXiv:2412.07744},
year = {2024}
}
备注
Project webpage available at https://zixuan-ye.github.io/stylemaster