中文

利用紧凑的文本感知一维 Token 普及文本到图像掩码生成模型

计算机视觉与模式识别 2025-08-05 v2

摘要

图像分词器构成了现代文本到图像生成模型的基础,但众所周知其训练非常困难。此外,大多数现有的文本到图像模型依赖于大规模、高质量的私有数据集,使其难以复现。在这项工作中,我们引入了文本感知 Transformer 一维分词器(TA-TiTok),这是一种高效且强大的图像分词器,可以利用离散或连续的一维 token。TA-TiTok 在分词器解码阶段(即去分词化)独特地集成了文本信息,从而加速了收敛并提升了性能。TA-TiTok 还受益于简化而有效的一阶段训练过程,消除了先前一维分词器中使用的复杂两阶段蒸馏。这种设计允许无缝扩展到大型数据集。在此基础上,我们引入了一系列文本到图像掩码生成模型,它们完全在开放数据上训练,同时实现了与在私有数据上训练的模型相当的性能。我们旨在发布高效、强大的 TA-TiTok 分词器以及开放数据、开放权重的 MaskGen 模型,以促进更广泛的访问并普及文本到图像掩码生成模型领域。

关键词

引用

@article{arxiv.2501.07730,
  title  = {Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens},
  author = {Dongwon Kim and Ju He and Qihang Yu and Chenglin Yang and Xiaohui Shen and Suha Kwak and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2501.07730},
  year   = {2025}
}

备注

ICCV 2025. Project page at https://tacju.github.io/projects/maskgen.html