中文

弥合鸿沟:探索桥接架构在复杂视觉推理任务上的能力

计算机视觉与模式识别 2023-08-01 v1 人工智能 计算与语言 机器学习

摘要

近来出现了大量基于大语言模型(LLM)的多模态架构,它们利用 LLM 的零样本生成能力,将图像嵌入投影到文本空间,然后使用自回归能力来解决视觉问答(VQA)、图像描述生成和图像检索等任务。我们将这些架构命名为“桥接架构(bridge-architectures)”,因为它们从图像空间投影到文本空间。这些模型偏离了训练基于 transformer 的多模态模型的常规方法,后者涉及使用大规模预训练和通过共注意力或交叉注意力实现的复杂多模态交互。然而,桥接架构在需要图像细粒度分析的复杂视觉推理任务上的能力尚未得到测试。在本项目中,我们研究了这些桥接架构在 NLVR2 数据集上的表现,并将其与最先进的基于 transformer 的架构进行比较。我们首先通过添加对象级特征以促进细粒度对象推理,将传统桥接架构扩展到 NLVR2 数据集。我们的分析表明,向桥接架构添加对象级特征并无帮助,且对多模态数据的预训练是在如 NLVR2 这样的复杂推理任务上取得良好表现的关键。我们还展示了近期桥接架构 LLaVA 在零样本设置下的一些初步结果并分析了其表现。

关键词

引用

@article{arxiv.2307.16395,
  title  = {Bridging the Gap: Exploring the Capabilities of Bridge-Architectures for Complex Visual Reasoning Tasks},
  author = {Kousik Rajesh and Mrigank Raman and Mohammed Asad Karim and Pranit Chawla},
  journal= {arXiv preprint arXiv:2307.16395},
  year   = {2023}
}