SFTok:离散分词器性能差距的桥接方案
计算机视觉与模式识别
2025-12-19 v1 机器学习
摘要
最近的多模态模型进展凸显了图像分词在高分辨率图像生成中的关键作用。通过将图像压缩为紧凑的潜在表示,分词器使生成模型能够在低维空间中运行,从而提高计算效率并降低复杂性。离散分词器自然与自回归范式相吻合,但仍落后于连续分词器,这限制了其在多模态系统中的采用。为此,我们提出了 \textbf{SFTok},这是一种集成多步骤迭代机制以实现精确重建的离散分词器。通过集成 \textbf{自我强制引导视觉重建} 和 \textbf{去偏置与拟合训练策略},SFTok 解决了多步骤过程中的训练-推理不一致问题,显著提升了图像重建质量。在仅 64 个图像 token 的高压缩率下,SFTok 在 ImageNet 上实现了最先进的重建质量(rFID = 1.21),并在类别到图像生成任务中表现突出(gFID = 2.29)。
引用
@article{arxiv.2512.16910,
title = {SFTok: Bridging the Performance Gap in Discrete Tokenizers},
author = {Qihang Rao and Borui Zhang and Wenzhao Zheng and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2512.16910},
year = {2025}
}
备注
Under review. Code is available at https://github.com/Neur-IO/SFTok