中文

RankE:离散文本到图像生成的端到端后训练框架

计算机视觉与模式识别 2026-05-21 v1

摘要

离散自回归(AR)文本到图像(T2I)模型将 VQ 标记化器与 AR 策略配对,当前的后训练管道仅优化策略而保持 VQ 解码器冻结。近期扩散 T2I 工作(以 REPA-E 为例)表明,VAE 本身构成了关键对齐瓶颈,但针对离散 AR 模型却没有类似的调查。我们表明,仅优化策略会导致潜在协变量迁移:随着策略演化,产生的标记分布偏离其上解码器训练的真实分布,使得奖励得分提升但解码图像质量下降。为解决这一不匹配,我们提出了 RankE,这是离散 T2I 生成的首个端到端后训练框架。与固定解码器优化策略不同,RankE 通过交替优化共同演化这两个组件:每个模块都最大化其基于排序的对齐目标,同时受到其参数空间中稳定性保持锚的正则化。这一共同演化打破了冻结解码器方法中存在的保真度--对齐权衡:在 LlamaGen-XL(775M)上,标准 RL 提升 CLIP 但降低 FID,而 RankE 同时提升两者(MS-COCO 30K 上 FID 15.21,CLIP 33.76)。Janus-Pro(1B)上的一致性提升确认,解码器共同演化可靠地将奖励优化转化为像素空间的质量提升。

关键词

引用

@article{arxiv.2605.21195,
  title  = {RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution},
  author = {Siyong Jian and Siyuan Li and Luyuan Zhang and Zedong Wang and Xin Jin and Ying Li and Cheng Tan and Huan Wang},
  journal= {arXiv preprint arXiv:2605.21195},
  year   = {2026}
}