中文

视觉编程:无需训练的组合视觉推理

计算机视觉与模式识别 2022-11-22 v1 人工智能 计算与语言

摘要

我们提出VISPROG,一种用于在给定的自然语言指令下解决复杂且组合性视觉任务的神经符号方法。VISPROG避免了任何特定任务训练的需求。相反,它利用大语言模型的上下文学习能力生成类Python的模块化程序,这些程序随后被执行以得到解决方案以及全面且可解释的推理过程。所生成程序的每一行可调用若干现成的计算机视觉模型、图像处理例程或Python函数之一,产生可能被程序后续部分使用的中间输出。我们在4项不同的任务上展示了VISPROG的灵活性——组合视觉问答、图像对的零样本推理、事实知识对象标注以及语言引导的图像编辑。我们相信像VISPROG这样的神经符号方法是轻松且有效地扩展AI系统以服务于人们可能希望执行的复杂任务长尾的一个令人振奋的途径。

关键词

引用

@article{arxiv.2211.11559,
  title  = {Visual Programming: Compositional visual reasoning without training},
  author = {Tanmay Gupta and Aniruddha Kembhavi},
  journal= {arXiv preprint arXiv:2211.11559},
  year   = {2022}
}