TIME:文本与图像互译对抗网络
计算机视觉与模式识别
2020-12-24 v2
摘要
针对文本到图像(T2I)生成,我们提出文本与图像互译对抗网络(TIME),这是一种轻量但有效的模型,在生成对抗网络框架下联合学习 T2I 生成器 G 和图像描述判别器 D。此前的方法将 T2I 问题视为单向任务,并使用预训练语言模型来强化图像—文本一致性,而 TIME 既不需要额外模块也不需要预训练。我们表明,将 G 与 D 作为语言模型联合训练可大幅提升 G 的性能。具体而言,我们采用 Transformers 来建模图像特征与词嵌入之间的跨模态连接,并设计了一种退火条件 hinge 损失以动态平衡对抗学习。在实验中,TIME 在 CUB 和 MS-COCO 数据集上取得了最先进(SOTA)性能(在 CUB 上 Inception Score 为 4.91,Fréchet Inception Distance 为 14.3),并在 MS-COCO 的图像描述和下游视觉—语言任务上展现出有前景的性能。
引用
@article{arxiv.2005.13192,
title = {TIME: Text and Image Mutual-Translation Adversarial Networks},
author = {Bingchen Liu and Kunpeng Song and Yizhe Zhu and Gerard de Melo and Ahmed Elgammal},
journal= {arXiv preprint arXiv:2005.13192},
year = {2020}
}
备注
AAAI-2021