中文

JEPA-T:用于图像生成的联合嵌入预测架构与文本融合

计算机视觉与模式识别 2025-10-02 v1

摘要

现代文本到图像(T2I)生成日益依赖以token为中心的架构,这些架构通过自监督训练,但有效融合文本与视觉token仍是一个挑战。我们提出\textbf{JEPA-T},一个统一的多模态框架,将图像和标题编码为离散的视觉和文本token,由联合嵌入预测Transformer处理。为增强融合,我们在特征预测器之后引入交叉注意力以实现条件去噪,同时保持任务无关的骨干网络。此外,原始文本嵌入在流匹配损失之前注入,以改善训练期间的对齐。在推理阶段,同一网络通过迭代地以文本为条件去噪视觉token,执行类条件图像生成和自由文本图像生成。在ImageNet-1K上的评估表明,JEPA-T实现了强大的数据效率、开词汇泛化能力,并持续优于非融合和后期融合基线。我们的方法表明,后期架构融合结合目标级对齐,在基于token的T2I中提供了条件强度与骨干通用性之间的有效平衡。代码现已开源:https://github.com/justin-herry/JEPA-T.git

关键词

引用

@article{arxiv.2510.00974,
  title  = {JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation},
  author = {Siheng Wan and Zhengtao Yao and Zhengdao Li and Junhao Dong and Yanshu Li and Yikai Li and Linshan Li and Haoyan Xu and Yijiang Li and Zhikang Dong and Huacan Wang and Jifeng Shen},
  journal= {arXiv preprint arXiv:2510.00974},
  year   = {2025}
}