中文

LAViTeR:由图像和描述生成辅助的对齐视觉与文本表示学习

计算机视觉与模式识别 2024-10-02 v4 人工智能 计算与语言

摘要

从大规模图像-文本对中预训练视觉和文本表示正成为许多下游视觉-语言任务的标准方法。基于 Transformer 的模型通过一系列自监督学习任务学习模态间和模态内的注意力。本文提出了 LAViTeR,一种用于视觉和文本表示学习的新型架构。其主要模块,视觉文本对齐(VTA),将由两个辅助任务辅助:基于 GAN 的图像合成和图像描述。我们还提出了一种新的评估指标,用于衡量学习到的视觉和文本嵌入之间的相似性。在两个公共数据集 CUB 和 MS-COCO 上的实验结果表明,在联合特征嵌入空间中,视觉和文本表示的对齐效果更优。

关键词

引用

@article{arxiv.2109.04993,
  title  = {LAViTeR: Learning Aligned Visual and Textual Representations Assisted by Image and Caption Generation},
  author = {Mohammad Abuzar Hashemi and Zhanghexuan Li and Mihir Chauhan and Yan Shen and Abhishek Satbhai and Mir Basheer Ali and Mingchen Gao and Sargur Srihari},
  journal= {arXiv preprint arXiv:2109.04993},
  year   = {2024}
}

备注

15 pages, 10 Figures, 5 Tables. Accepted for Oral Presentation at Irish Machine Vision and Image Processing Conference Proceedings (IMVIP), 2024