中文

UniFlow:用于视觉理解和生成的统一像素流标记器

计算机视觉与模式识别 2026-03-03 v2

摘要

标记器是视觉理解和生成中的关键组件。为了迈向通用建模的终极目标,近期研究致力于开发统一标记器。然而,现有标记器在理解和生成之间面临显著的性能权衡,这源于高级语义抽象与低级像素重建之间的内在冲突。为解决这一挑战,我们提出了一种通用且统一的标记器,称为 UniFlow,通过灵活地将任何视觉编码器与简洁的重建解码器相适配。具体而言,我们引入应用于预训练视觉编码器上的层级自蒸馏,这使 UniFlow 能够同时继承强大的语义特征以用于视觉理解,并灵活地适应以建模细粒度细节以用于视觉生成。此外,我们提出了轻量级的 patch-wise 像素流解码器,通过建模从噪声状态到 patch-wise 像素域的条件流,有效实现高保真像素重建。通过将语义特征作为解码器的视觉条件,我们有效地缓解了理解与生成之间的训练冲突。此外,patch-wise 学习策略简化了数据分布,从而提高了训练效率。在遍布 13 个具有挑战性基准的广泛实验中,涵盖 7 个广泛研究的视觉理解和生成任务,证明 UniFlow 实现了实现双赢局面。例如,我们的7B UniFlow-XL 不仅在平均理解基准上超过 14B TokenFlow-XL 提升了 6.05%,而且在视觉重建和生成方面取得了具有竞争力的结果,分别在不使用引导的情况下超越 UniTok 0.15 的 rFID 和 0.09 的 gFID。

关键词

引用

@article{arxiv.2510.10575,
  title  = {UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation},
  author = {Zhengrong Yue and Haiyu Zhang and Xiangyu Zeng and Boyu Chen and Chenting Wang and Shaobin Zhuang and Lu Dong and Yi Wang and Limin Wang and Yali Wang},
  journal= {arXiv preprint arXiv:2510.10575},
  year   = {2026}
}

备注

ICLR 2026