InsightTok:提升离散标记化自回归图像生成中的文本与人脸保真度
计算机视觉与模式识别
2026-05-15 v1
摘要
文本和人脸是视觉生成中最具感知敏感性和实用价值的模式,但对基于离散标记化的自回归生成器而言仍是具有挑战性的。核心瓶颈在于标记化器:粗糙的下采样和量化往往丢弃维持可读字符和鲜明面部特征所需的细粒度结构。我们认为这一差距源于标准离散标记化目标与文本可读性和人脸保真度之间弱对齐——这些目标通常针对通用重构进行优化,同时对异构内容进行统一压缩。为此,我们提出InsightTok,一种通过局部、内容感知感知损失提升文本和人脸保真度的简单有效的离散视觉标记化框架。在16k词汇表且16倍下采样率下,InsightTok在文本和人脸重构方面显著优于先前方法,同时不损害通用重构质量。这些提升稳定地推动至InsightAR中的自回归图像生成,生成图像在文本清晰度和人脸细节忠实度方面均得到提升。总体而言,本研究凸显了在标记化训练中采用专门化监督对推进离散图像生成具有潜在价值。
引用
@article{arxiv.2605.14333,
title = {InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation},
author = {Yang Yue and Fangyun Wei and Tianyu He and Jinjing Zhao and Zanlin Ni and Zeyu Liu and Jiayi Guo and Lei Shi and Yue Dong and Li Chen and Ji Li and Gao Huang and Dong Chen},
journal= {arXiv preprint arXiv:2605.14333},
year = {2026}
}
备注
Code and checkpoints are available at https://github.com/LeapLabTHU/InsightTok