中文

CSD-VAR:视觉自回归模型中的内容-风格分解

计算机视觉与模式识别 2026-03-17 v2 人工智能

摘要

从单张图像中解耦内容和风格,即内容-风格分解(CSD),能够实现提取内容的再语境化和提取风格的风格化,为视觉合成提供了更大的创作灵活性。虽然最近的个性化方法探索了显式内容风格的分解,但它们仍然是针对扩散模型量身定制的。与此同时,视觉自回归建模(VAR)作为一种有前景的替代方案出现,采用下一尺度预测范式,实现了与扩散模型相当的性能。在本文中,我们探索VAR作为CSD的生成框架,利用其尺度级生成过程来改进解耦。为此,我们提出了CSD-VAR,一种新颖的方法,引入了三个关键创新:(1) 一种尺度感知的交替优化策略,将内容和风格表示与其各自的尺度对齐以增强分离;(2) 一种基于SVD的校正方法,以减轻内容泄漏到风格表示中;(3) 一种增强内容身份保持的增强型键值(K-V)记忆。为了对该任务进行基准测试,我们引入了CSD-100,一个专门为内容-风格分解设计的数据集,包含以各种艺术风格渲染的不同主题。实验表明,CSD-VAR优于先前的方法,实现了卓越的内容保持和风格化保真度。

关键词

引用

@article{arxiv.2507.13984,
  title  = {CSD-VAR: Content-Style Decomposition in Visual Autoregressive Models},
  author = {Quang-Binh Nguyen and Minh Luu and Quang Nguyen and Anh Tran and Khoi Nguyen},
  journal= {arXiv preprint arXiv:2507.13984},
  year   = {2026}
}

备注

Accepted to ICCV 2025; Project page: https://nqbinhcs.github.io/csd-var-page/