中文

Pyramid Coder: 用于组合式视觉问答的分层代码生成器

计算机视觉与模式识别 2024-07-31 v1 人工智能

摘要

视觉问答(VQA)是基于视觉输入为自然语言问题提供准确答案的任务。程序化视觉问答(PVQA)模型近期受到关注。这些模型使用大语言模型(LLM)来生成可执行的程序,以解决需要复杂视觉推理的问题。然而,让LLM理解图像处理模块的用法并生成相关代码存在挑战。为克服这些挑战,本文提出了PyramidCoder,一种用于PVQA模型的新型提示框架。PyramidCoder由三个分层级别组成,每个级别服务于不同的目的:查询重述、代码生成和答案聚合。值得注意的是,PyramidCoder在每个级别仅使用一个冻结的LLM和预定义的提示,无需额外训练,并确保在不同LLM架构之间的灵活性。与最先进的PVQA模型相比,我们的方法在GQA数据集上准确率至少提高0.5%,在VQAv2数据集上提高1.4%,在NLVR2数据集上提高2.9%。

关键词

引用

@article{arxiv.2407.20563,
  title  = {Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering},
  author = {Ruoyue Shen and Nakamasa Inoue and Koichi Shinoda},
  journal= {arXiv preprint arXiv:2407.20563},
  year   = {2024}
}

备注

Accepted to the IEEE International Conference on Image Processing (IEEE ICIP) 2024