通过代码生成实现模块化视觉问答
计算与语言
2023-06-09 v1
摘要
我们提出一个将视觉问答表述为模块化代码生成的框架。与先前关于 VQA 模块化方法的工作不同,我们的方法无需额外训练,并依赖于预训练语言模型(LMs)、在图像- caption 对上预训练的视觉模型,以及用于上下文学习的五十个 VQA 示例。生成的 Python 程序通过算术与条件逻辑调用并组合视觉模型的输出。与不使用代码生成的少样本基线相比,我们的方法在 COVR 数据集上准确率提升至少 3%,在 GQA 数据集上提升约 2%。
引用
@article{arxiv.2306.05392,
title = {Modular Visual Question Answering via Code Generation},
author = {Sanjay Subramanian and Medhini Narasimhan and Kushal Khangaonkar and Kevin Yang and Arsha Nagrani and Cordelia Schmid and Andy Zeng and Trevor Darrell and Dan Klein},
journal= {arXiv preprint arXiv:2306.05392},
year = {2023}
}
备注
ACL 2023