重新思考离散标记:将其作为连续自回归图像合成的条件
计算机视觉与模式识别
2025-07-23 v2
摘要
最近的大型语言模型(LLM)进展推动了将图像编码为离散标记并利用自回归(AR)框架进行视觉生成的兴趣。然而,AR 基于视觉生成模型中的量化过程本质上会引入信息损失,导致图像保真度下降。为缓解这一局限,最近的研究探索了自回归预测连续标记。与离散标记位于结构化有界空间不同,连续表示存在于非有限、高维空间中,这更具挑战性,增加了生成超分布 artifact 的风险。基于上述发现,本工作引入 DisCon(离散-条件连续自回归模型),一种新型框架重新解释离散标记作为条件信号而非生成目标。通过对连续表示在离散标记条件下的条件概率进行建模,DisCon 规避了连续标记建模的优化挑战,同时避免了量化导致的信息损失。DisCon 在 ImageNet 256×256 生成上实现了 1.38 的 gFID 分数,显著优于最先进的自回归方法。项目页面:https://pengzheng0707.github.io/DisCon。
引用
@article{arxiv.2507.01756,
title = {Rethinking Discrete Tokens: Treating Them as Conditions for Continuous Autoregressive Image Synthesis},
author = {Peng Zheng and Junke Wang and Yi Chang and Yizhou Yu and Rui Ma and Zuxuan Wu},
journal= {arXiv preprint arXiv:2507.01756},
year = {2025}
}
备注
iccv 2025, camera-ready version