中文

VSA4VQA:将向量符号架构扩展至自然图像上的视觉问答

计算机视觉与模式识别 2024-05-08 v1 人工智能

摘要

虽然向量符号架构(VSAs)在建模空间认知方面前景广阔,但其应用目前仅限于人工生成图像和简单空间查询。我们提出 VSA4VQA - 一个 4D 实施的 VSAs,用于在具有挑战性的视觉问答(VQA)任务中对自然图像进行心理表征。VSA4VQA 是首个将 VSAs 扩展至复杂空间查询的模型。Our method 基于语义指针架构(SPA)对对象进行超高维向量空间编码。为编码自然图像,我们将 SPA 扩展到包括对象宽度和高度维度,除其空间位置外。为执行空间查询,我们进一步引入学习的空间查询掩码,并集成预训练的视觉语言模型以回答属性相关问题。我们在 GQA 数据集上进行评估,表明该方法能够有效地编码自然图像,在零样本 VQA 中实现了与最先进深度学习方法的有竞争力的性能。

关键词

引用

@article{arxiv.2405.03852,
  title  = {VSA4VQA: Scaling a Vector Symbolic Architecture to Visual Question Answering on Natural Images},
  author = {Anna Penzkofer and Lei Shi and Andreas Bulling},
  journal= {arXiv preprint arXiv:2405.03852},
  year   = {2024}
}

备注

To be published in the Proceedings of the Annual Meeting of the Cognitive Science Society (CogSci'24)