中文

DreamStyle:视频风格化统一框架

计算机视觉与模式识别 2026-01-07 v1

摘要

视频风格化作为视频生成模型的重要下游任务,目前尚未得到充分探索。其输入风格条件通常包括文本、风格图像和已风格化的首帧。每种条件都具有特有的优势:文本更灵活,风格图像提供更精确的视觉锚点,已风格化首帧使长视频风格化成为可能。然而,现有方法大多局限于单一种类的风格条件,限制了其应用范围。此外,缺乏高质量数据集导致风格不一致和时间性闪烁。为此,本文引入DreamStyle,一个支持(1)文本引导、(2)风格图像引导、(3)首帧引导视频风格化的统一框架,并配套精心设计的数据 curated 流程以获取高质量配对视频数据。DreamStyle基于基础Image-to-Video(I2V)模型构建,使用带有token-specific上矩阵的Low-Rank Adaptation(LoRA)训练,以减少不同条件token之间的混淆。定性和定量评估表明,DreamStyle在所有三种视频风格化任务中都表现出色,在风格一致性和视频质量方面超越了竞争方法。

关键词

引用

@article{arxiv.2601.02785,
  title  = {DreamStyle: A Unified Framework for Video Stylization},
  author = {Mengtian Li and Jinshu Chen and Songtao Zhao and Wanquan Feng and Pengqi Tu and Qian He},
  journal= {arXiv preprint arXiv:2601.02785},
  year   = {2026}
}

备注

Github Page: https://lemonsky1995.github.io/dreamstyle/