中文

TIME:文本与图像互译对抗网络

计算机视觉与模式识别 2020-12-24 v2

摘要

针对文本到图像(T2I)生成,我们提出文本与图像互译对抗网络(TIME),这是一种轻量但有效的模型,在生成对抗网络框架下联合学习 T2I 生成器 G 和图像描述判别器 D。此前的方法将 T2I 问题视为单向任务,并使用预训练语言模型来强化图像—文本一致性,而 TIME 既不需要额外模块也不需要预训练。我们表明,将 G 与 D 作为语言模型联合训练可大幅提升 G 的性能。具体而言,我们采用 Transformers 来建模图像特征与词嵌入之间的跨模态连接,并设计了一种退火条件 hinge 损失以动态平衡对抗学习。在实验中,TIME 在 CUB 和 MS-COCO 数据集上取得了最先进(SOTA)性能(在 CUB 上 Inception Score 为 4.91,Fréchet Inception Distance 为 14.3),并在 MS-COCO 的图像描述和下游视觉—语言任务上展现出有前景的性能。

关键词

引用

@article{arxiv.2005.13192,
  title  = {TIME: Text and Image Mutual-Translation Adversarial Networks},
  author = {Bingchen Liu and Kunpeng Song and Yizhe Zhu and Gerard de Melo and Ahmed Elgammal},
  journal= {arXiv preprint arXiv:2005.13192},
  year   = {2020}
}

备注

AAAI-2021