中文

DiverseVAR:平衡下一尺度视觉自回归模型的多样性与质量

计算机视觉与模式识别 2025-11-27 v1

摘要

我们介绍DiverseVAR,一种增强文本条件视觉自回归模型(VAR)在测试时多样性的框架,无需重新训练、微调或大量计算开销。虽然VAR模型最近涌现为扩散模型和流模型的强大竞争者用于图像生成,但它们在多样性方面存在严重限制,往往即使针对简单提示也几乎生成相同的图像。此问题在主要关注图像质量的背景下基本被忽视了。我们在测试时以两个阶段解决此限制。首先,受扩散模型中的多样性增强技术启发,我们提出对文本嵌入注入噪声。这引入了多样性与图像质量之间的权衡:随着多样性的增加,图像质量会急剧下降。为保持质量,我们提出尺度旅行:一种受扩散模型中时间旅行策略启发的新型潜在细化技术。具体而言,我们使用多尺度自编码器提取粗糙尺度标记,从而允许在中间阶段恢复生成。大量实验表明,结合文本嵌入噪声注入和我们的尺度旅行细化,显著增强了多样性,同时最小化了图像质量损失,在多样性-质量权衡上实现了新的Pareto前沿。

关键词

引用

@article{arxiv.2511.21415,
  title  = {DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models},
  author = {Mingue Park and Prin Phunyaphibarn and Phillip Y. Lee and Minhyuk Sung},
  journal= {arXiv preprint arXiv:2511.21415},
  year   = {2025}
}