StyleVAR:基于视觉自回归建模的可控图像风格迁移
计算机视觉与模式识别
2026-05-13 v2 人工智能
摘要
我们在视觉自回归建模(VAR)框架基础上,将风格迁移表述为在学习到的潜在空间中进行条件离散序列建模。图像被分解为多尺度表示并通过 VQ-VAE 离散化为离散代码;transformer 然后自回归地建模目标 token 的分布,条件于风格和内容 token。为注入风格和内容信息,我们引入了混合跨注意力机制,其中正在演化的目标表示会关注自身历史,而风格和内容特征则充当查询,决定此历史应突出哪些方面。比例依赖的混合系数控制每个阶段风格和内容的相对影响,鼓励合成表示与内容结构和风格纹理保持一致,同时不破坏VAR的自回归连续性。我们在预训练的 VAR 检查点基础上进行两阶段训练:首先在大型内容-风格-目标图像三元组数据集上进行监督微调,然后利用基于 DreamSim 的感知奖励进行强化学习微调,采用 Group Relative Policy Optimization(GRPO),并对每个动作进行归一化加权,以在VAR的多尺度层级结构中重新分配信用。在三个覆盖述内、近似内外分布 regime 的基准测试中,StyleVAR 在风格损失、内容损失、LPIPS、SSIM、DreamSim 和 CLIP 相似性方面持续优于 AdaIN 基线,GRPO 阶段在奖励对齐的感知指标上取得进一步提升,尤其显著。从定性来看,该方法在保持语义结构的同时实现了纹理迁移,尤其适用于风景和建筑场景;然而,互联网图像上的泛化差距以及对人脸的困难处理凸显了需要更好内容多样性和更强结构性先验的需求。
引用
@article{arxiv.2604.21052,
title = {StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling},
author = {Liqi Jing and Dingming Zhang and Peinian Li and Lichen Zhu and Yang Xu and Hanyu Xing},
journal= {arXiv preprint arXiv:2604.21052},
year = {2026}
}