中文

DreamVAR:控制强化视觉自回归模型以实现高保真主题驱动图像生成

计算机视觉与模式识别 2026-02-02 v1

摘要

近期的主体驱动图像生成方法使用扩散模型取得了显著进展,备受关注。然而,尽管视觉自回归 (VAR) 模型拥有统一架构和高效推理能力,其潜力仍未得到充分探索。本文提出 DreamVAR,一种基于 VAR 模型构建的主体驱动图像合成框架,采用下一尺度预测技术。技术上,首先通过视觉标记器提取参考主体的多尺度特征。与在不同尺度之间交叉插入这些条件特征与目标图像标记的方法不同,DreamVAR 在预测目标图像标记前预先填充完整的主体特征序列。这种设计简化了自回归依赖关系,缓解了 VAR 范式下多尺度条件情境中的训练-测试差异。DreamVAR 进一步融合强化学习,以联合提升语义对齐度和主体一致性。大量实验表明,DreamVAR 在保持原貌方面优于领先的基于扩散的方法。

关键词

引用

@article{arxiv.2601.22507,
  title  = {DreamVAR: Taming Reinforced Visual Autoregressive Model for High-Fidelity Subject-Driven Image Generation},
  author = {Xin Jiang and Jingwen Chen and Yehao Li and Yingwei Pan and Kezhou Chen and Zechao Li and Ting Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2601.22507},
  year   = {2026}
}

备注

Accepted By ICASSP 2026