中文

L-Verse:图像与文本间的双向生成

计算机视觉与模式识别 2022-04-07 v9 计算与语言 机器学习

摘要

除了学习自然语言的远距离交互外,transformer凭借其性能与可扩展性,正成为许多视觉任务的事实标准。尤其在图像与文本跨模态任务中,向量量化变分自编码器(VQ-VAE)被广泛用于将原始RGB图像转换为特征向量序列。为更好利用图像与文本间的相关性,我们提出L-Verse,一种由特征增强变分自编码器(AugVAE)和用于图像到文本及文本到图像生成的双向自回归transformer(BiART)组成的新颖架构。我们的AugVAE在ImageNet1K验证集上展现出最先进的重建性能,并对真实场景中未见过的图像具有鲁棒性。与其他模型不同,BiART能区分图像(或文本)作为条件参考与生成目标。L-Verse无需任何微调或额外目标检测框架即可直接用于图像到文本或文本到图像生成。在定量与定性实验中,L-Verse在MS-COCO Captions上的图像到文本和文本到图像生成均展现出优于先前方法的令人印象深刻的结果。我们进一步在Conceptual Captions上评估L-Verse架构的可扩展性,并给出通用领域双向视觉-语言表示学习的初步结果。

关键词

引用

@article{arxiv.2111.11133,
  title  = {L-Verse: Bidirectional Generation Between Image and Text},
  author = {Taehoon Kim and Gwangmo Song and Sihaeng Lee and Sangyun Kim and Yewon Seo and Soonyoung Lee and Seung Hwan Kim and Honglak Lee and Kyunghoon Bae},
  journal= {arXiv preprint arXiv:2111.11133},
  year   = {2022}
}

备注

Accepted to CVPR 2022 as Oral Presentation (18 pages, 14 figures, 4 tables)