中文

iFSQ:通过一行代码改进图像生成中的 FSQ

计算机视觉与模式识别 2026-01-28 v2

摘要

图像生成领域目前分为两种主流方法:一种是基于离散标记的自回归(AR)模型,另一种是利用连续潜在变量的扩散模型。这两种方法的分歧源于 VQ-VAE 与 VAE 差异,导致统一建模和公平基准测试受阻。有限标量量化(FSQ)提供了理论上的桥梁,但原始 FSQ 存在关键缺陷:等间隔量化可能导致激活崩溃。这一不匹配迫使人们在重建保真度与信息效率之间做出权衡。本文通过替换原始 FSQ 中的激活函数,采用分布匹配映射以实现均匀先验,从而解决了这一困境。称其为 iFSQ,这一简单策略仅需一行代码,却在数学上保证了最佳的 bin 使用率和重建精度。借助 iFSQ 作为受控基准,我们发现两个关键洞见:(1)离散表示与连续表示之间的最优平衡点大约在每维度 4 位;(2)在相同的重建约束下,AR 模型在初始收敛方面表现迅速,而扩散模型则在性能上限方面取得优异结果,表明严格的顺序结构可能限制生成质量的上限。最后,我们通过将表示对齐(REPA)应用于 AR 模型,得到了 LlamaGen-REPA。代码已公开于 https://github.com/Tencent-Hunyuan/iFSQ

关键词

引用

@article{arxiv.2601.17124,
  title  = {iFSQ: Improving FSQ for Image Generation with 1 Line of Code},
  author = {Bin Lin and Zongjian Li and Yuwei Niu and Kaixiong Gong and Yunyang Ge and Yunlong Lin and Mingzhe Zheng and JianWei Zhang and Miles Yang and Zhao Zhong and Liefeng Bo and Li Yuan},
  journal= {arXiv preprint arXiv:2601.17124},
  year   = {2026}
}

备注

Technical Report; Fixed eq.7 & 8 and corresponding content