中文

RecTok:沿有向流重构蒸馏

计算机视觉与模式识别 2025-12-18 v2

摘要

视觉记事器在扩散模型中起着关键作用。潜在空间的维度既决定了重构保真度,也决定了潜在特征的语义表达能力。然而,维度与生成质量之间存在根本性的权衡,这限制了现有方法使用低维潜在空间。尽管近期工作利用视觉基础模型丰富视觉记事器的语义并加快收敛速度,但高维记事器仍不及其低维对手。本文提出 RecTok,通过两种关键创新突破了高维视觉记事器的局限性:流语义蒸馏和重构-对齐蒸馏。我们的关键洞察是:使流匹配中的前向流在语义上更丰富,这些流作为扩散变换器的训练空间,而非像以往工作那样聚焦于潜在空间。具体而言,我们的方法将 VFMs 中的语义信息蒸馏到流匹配中前向流轨迹中,并通过引入掩码特征重构损失进一步增强语义。我们的 RecTok 在图像重构、生成质量和判别性能方面均实现了卓越的表现。在 gFID-50K 指标上实现了最先进的结果,无论是否使用无分类器自由指导均表现出色,同时保持语义丰富的潜在空间结构。此外,随着潜在维度的增加,我们观察到性能持续提升。代码和模型已公开于 https://shi-qingyu.github.io/rectok.github.io

关键词

引用

@article{arxiv.2512.13421,
  title  = {RecTok: Reconstruction Distillation along Rectified Flow},
  author = {Qingyu Shi and Size Wu and Jinbin Bai and Kaidong Yu and Yujing Wang and Yunhai Tong and Xiangtai Li and Xuelong Li},
  journal= {arXiv preprint arXiv:2512.13421},
  year   = {2025}
}