LAViTeR:由图像和描述生成辅助的对齐视觉与文本表示学习
计算机视觉与模式识别
2024-10-02 v4 人工智能
计算与语言
摘要
从大规模图像-文本对中预训练视觉和文本表示正成为许多下游视觉-语言任务的标准方法。基于 Transformer 的模型通过一系列自监督学习任务学习模态间和模态内的注意力。本文提出了 LAViTeR,一种用于视觉和文本表示学习的新型架构。其主要模块,视觉文本对齐(VTA),将由两个辅助任务辅助:基于 GAN 的图像合成和图像描述。我们还提出了一种新的评估指标,用于衡量学习到的视觉和文本嵌入之间的相似性。在两个公共数据集 CUB 和 MS-COCO 上的实验结果表明,在联合特征嵌入空间中,视觉和文本表示的对齐效果更优。
引用
@article{arxiv.2109.04993,
title = {LAViTeR: Learning Aligned Visual and Textual Representations Assisted by Image and Caption Generation},
author = {Mohammad Abuzar Hashemi and Zhanghexuan Li and Mihir Chauhan and Yan Shen and Abhishek Satbhai and Mir Basheer Ali and Mingchen Gao and Sargur Srihari},
journal= {arXiv preprint arXiv:2109.04993},
year = {2024}
}
备注
15 pages, 10 Figures, 5 Tables. Accepted for Oral Presentation at Irish Machine Vision and Image Processing Conference Proceedings (IMVIP), 2024