中文

语义感知前缀学习用于令牌高效的图像生成

计算机视觉与模式识别 2026-03-27 v1

摘要

视觉分词器在潜在图像生成中扮演核心角色,通过连接高维图像与可处理的生成建模。然而,大多数现有分词器仍以重建主导的目标进行训练,这通常导致潜在表示仅弱地与高层语义对齐。近期方法改善了语义对齐,但通常将语义信号视为辅助正则化而非使其在表示学习中成为功能必需。我们提出 SMAP,一种语义感知前缀分词器,将类别级语义条件注入基于查询的一维分词框架。为使语义在训练中不可或缺,SMAP 引入尾部令牌丢弃策略,迫使语义条件和早期潜在前缀在逐步减少的令牌预算下承担递增责任。为验证所得潜在空间对生成而非仅重建有用,我们进一步引入 CARD,一种混合因果自回归-扩散生成器。在 ImageNet 上的广泛实验表明,SMAP 在离散和连续分词设置中一致提升重建质量,其语义锚定的潜在空间在紧凑令牌预算下产生了强大的下游生成性能。

关键词

引用

@article{arxiv.2603.25249,
  title  = {Semantic-Aware Prefix Learning for Token-Efficient Image Generation},
  author = {Qingfeng Li and Haoxian Zhang and Xu He and Songlin Tang and Zhixue Fang and Xiaoqiang Liu and Pengfei Wan Guoqi Li},
  journal= {arXiv preprint arXiv:2603.25249},
  year   = {2026}
}