中文

AdaCoder: 面向程序化视觉问答的自适应提示压缩

人工智能 2024-07-30 v1 计算机视觉与模式识别 多媒体

摘要

视觉问答旨在根据视觉输入提供自然语言问题的响应。最近,基于大语言模型(LLMs)生成可执行程序来回答问题的视觉程序模型(VPMs)受到关注。然而,这些模型通常需要较长的输入提示才能为LLM提供足够的API使用细节以生成相关代码。为此,我们提出了AdaCoder——一种面向VPM的自适应提示压缩框架。AdaCoder包含两个阶段:压缩阶段和推理阶段。在压缩阶段,给定描述Python中所有API定义的preprompt及代码示例片段,生成一组依赖于特定问题类型的压缩preprompt。在推理阶段,给定输入问题,AdaCoder预测问题类型并选择相应的压缩preprompt以生成回答问题的代码。值得注意的是,AdaCoder仅使用单个冻结的LLM和预定义的提示,无需额外训练,同时保持适应性,能够适用于如GPT和Claude等不同强大的黑箱LLM。在实验中,我们将AdaCoder应用到ViperGPT上,证明其将提示token长度缩短71.1%,同时保持甚至提升视觉问答性能。

关键词

引用

@article{arxiv.2407.19410,
  title  = {AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering},
  author = {Mahiro Ukai and Shuhei Kurita and Atsushi Hashimoto and Yoshitaka Ushiku and Nakamasa Inoue},
  journal= {arXiv preprint arXiv:2407.19410},
  year   = {2024}
}