中文

FlowTok:在文本和图像标记之间无缝流动

计算机视觉与模式识别 2025-11-27 v3

摘要

跨模态生成的核心在于跨模态桥接。虽然传统方法将文本模态视为条件信号,逐步引导从高斯噪声到目标图像模态的去噪过程,但我们探索了一种更简单的方法——直接通过流匹配在文本和图像模态之间演化。这需要将两种模态投影到共享的潜空间,由于其固有的不同表示:文本高度语义化,编码为 1D 标记;而图像在空间上是冗余的,表示为 2D 潜在嵌入。为此,我们引入 FlowTok,一个最小框架,通过将图像编码为紧凑的 1D 标记表示,实现文本和图像之间的无缝流动。与先前方法相比,这一设计在图像分辨率为 256 时,将潜在空间大小降低 3.3 倍,消除对复杂条件机制或噪声调度的需求。此外,FlowTok 自然扩展到图像到文本生成,适用相同的公式。凭借以紧凑 1D 标记为中心的简洁架构,FlowTok 在内存效率、训练资源需求和采样速度方面都表现出色,同时在性能上与最先进的模型相当。代码已公开 https://github.com/TACJu/FlowTok。

关键词

引用

@article{arxiv.2503.10772,
  title  = {FlowTok: Flowing Seamlessly Across Text and Image Tokens},
  author = {Ju He and Qihang Yu and Qihao Liu and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2503.10772},
  year   = {2025}
}

备注

Project page at https://tacju.github.io/projects/flowtok.html