潜在去噪让 Tokenizer 更好
计算机视觉与模式识别
2026-02-17 v2
摘要
尽管其基础作用已备受关注,但仍不清楚哪些属性能使 tokenizer 在生成建模中更有效。我们注意到,现代生成模型共享类似的训练目标——从被破坏的输入中重建干净信号,例如因高斯噪声或遮盖导致的信号退化,这一过程我们称为去噪。因此,我们提出将 tokenizer 的嵌入直接与下游去噪目标对齐,鼓励嵌入在显著损坏后仍可被重建。为实现此目标,我们引入了潜在去噪 Tokenizer(l-DeTok),这是一种简单却高度有效的 tokenizer,其训练目标是从被通过插值噪声或随机遮盖损坏的潜在嵌入中重建干净图像。针对 class-conditioned(ImageNet 256x256 和 512x512)和 text-conditioned(MSCOCO)图像生成基准进行大规模实验,结果表明与先前的 tokenizer 相比,l-DeTok 在六个代表性生成模型上 consistently 提升了生成质量。我们的发现凸显了去噪作为 tokenizer 开发的基本设计原则,并希望能为未来 tokenizer 设计开辟新视角。
引用
@article{arxiv.2507.15856,
title = {Latent Denoising Makes Good Tokenizers},
author = {Jiawei Yang and Tianhong Li and Lijie Fan and Yonglong Tian and Yue Wang},
journal= {arXiv preprint arXiv:2507.15856},
year = {2026}
}
备注
Code is available at: https://github.com/Jiawei-Yang/DeTok