中文

基于双文本嵌入的文本到图像合成端到端训练

计算机视觉与模式识别 2025-02-04 v1

摘要

文本到图像(T2I)合成是一项具有挑战性的任务,需要建模两种模态(即文本和图像)之间的复杂交互。近期领先方法普遍采用以对比损失训练的预训练图像对齐文本嵌入来实现此类多模态交互的框架。此外,这些嵌入通常通用性训练,跨越各种合成模型重用。在本文中,我们探索了一种针对T2I合成网络学习文本嵌入的方法,采用端到端训练方式。进一步,我们结合生成式和对比式训练,使用两个嵌入:一个优化以增强生成图像的照片 realism,另一个寻求捕捉文本到图像的对齐。对三组文本到图像基准数据集(Oxford-102、Caltech-UCSD 和 MS-COCO)进行全面实验表明,使用两个独立嵌入比使用共享嵌入效果更好,且该方法在使用预训练文本编码器(采用判别式方法训练)获取的文本表示方法方面表现优于其他方法。最后,我们展示了这些学习到的嵌入在其他上下文中也可使用,例如文本到图像 manipulation。

关键词

引用

@article{arxiv.2502.01507,
  title  = {End-to-end Training for Text-to-Image Synthesis using Dual-Text Embeddings},
  author = {Yeruru Asrar Ahmed and Anurag Mittal},
  journal= {arXiv preprint arXiv:2502.01507},
  year   = {2025}
}