中文

VA-π:用于像素感知自回归生成的变分策略对齐

计算机视觉与模式识别 2025-12-23 v1

摘要

自回归(AR)视觉生成依赖 tokenizer 将图像映射到离散序列之间。然而,tokenizer 训练时旨在从 ground-truth tokens 重建干净图像,而 AR 生成器仅优化 token 的似然性。这一对齐不足导致生成的 token 序列可能解码出低质量图像,无法获得像素空间的直接监督。我们提出了 VA-π,一个轻量级的后训练框架,直接以原则性的像素空间目标优化 AR 模型。VA-π 将生成器-tokenizer 对齐形式化为变分优化,推导出一个证据下界(ELBO),统一了像素重建和自回归建模。为在离散 token 空间上优化,VA-π 引入一种基于强化学习的对齐策略,将 AR 生成器视为策略,利用像素空间重建质量作为其内在奖励。该奖励通过在教师强制下测量预测 token 序列重建原始图像的能力进行度量,使模型获得无需昂贵自由运行抽样的直接像素级指导。ELBO 的正则化项作为自然正则器,维持 token 的分布一致性。VA-π 使现有 AR 生成器能够快速适应,无需重新训练 tokenizer 或使用外部奖励模型。仅需 1% 的 ImageNet-1K 数据和 25 分钟的调优,即可将 FID 从 14.36 降至 7.65,将 IS 从 86.55 提升至 116.70于 LlamaGen-XXL,并在 GenEval 上的文本到图像任务中为视觉生成模型(LlamaGen:从 0.306 提升至 0.339)和统一多模态模型(Janus-Pro:从 0.725 提升至 0.744)取得显著提升。代码已公开于 https://github.com/Lil-Shake/VA-Pi。

关键词

引用

@article{arxiv.2512.19680,
  title  = {VA-$\pi$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation},
  author = {Xinyao Liao and Qiyuan He and Kai Xu and Xiaoye Qu and Yicong Li and Wei Wei and Angela Yao},
  journal= {arXiv preprint arXiv:2512.19680},
  year   = {2025}
}

备注

21 pages, 24 figures