面向分词器与自回归模型之间的序列建模对齐
计算机视觉与模式识别
2026-02-17 v3
摘要
自回归图像生成旨在基于先前的标记预测下一个标记。然而,这一过程受到传统图像分词中固有的双向依赖的挑战,这与自回归模型单向特性产生了根本性的不匹配。为解决此问题,我们引入 AliTok,一种新颖的对齐分词器,它改变了标记序列的依赖结构。AliTok 采用受因果解码器约束的双向编码器,该设计迫使编码器产生兼具语义丰富性和前向依赖的标记序列。此外,通过引入前缀标记并采用两阶段分词器训练过程来增强重建性能,AliTok 同时实现了高保真度和可预测性。基于 AliTok,一个仅含 177M 参数的标准仅解码器自回归模型在 ImageNet-256 上实现了 1.44 的 gFID 和 319.5 的 IS。扩展到 662M 时,我们的模型达到 1.28 的 gFID,以 10 倍更快的采样速度超越了 SOTA 扩散方法。在 ImageNet-512 上,我们的 318M 模型同样达到了 1.39 的 SOTA gFID。代码和权重位于 https://github.com/ali-vilab/alitok。
引用
@article{arxiv.2506.05289,
title = {Towards Sequence Modeling Alignment between Tokenizer and Autoregressive Model},
author = {Pingyu Wu and Kai Zhu and Yu Liu and Longxiang Tang and Jian Yang and Yansong Peng and Wei Zhai and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2506.05289},
year = {2026}
}
备注
ICLR2026