AssistGPT:一种可规划、执行、检查与学习的通用多模态助手
计算机视觉与模式识别
2023-06-29 v2
摘要
近期关于大语言模型(LLMs)的研究推动了通用 NLP AI 助手的显著进展。部分研究进一步探索使用 LLMs 进行规划并调用模型或 API 以应对更通用的多模态用户查询。尽管取得进展,复杂的基于视觉的任务因视觉任务多样性仍具挑战。该多样性体现在两方面:1)推理路径。对于许多真实应用,仅通过审视查询本身难以准确分解任务,通常需基于具体视觉内容与每步结果进行规划。2)灵活输入与中间结果。真实场景中输入形式灵活,不仅包含单张图像或视频,也涉及视频与图像混合,例如带若干参考视频的用户视角图像。此外,复杂推理过程还会产生多样多模态中间结果,如视频叙述、分割视频片段等。为应对此类通用情况,我们提出多模态 AI 助手 AssistGPT,采用一种称为规划、执行、检查与学习(PEIL)的交错代码与语言推理方法,将 LLMs 与各类工具集成。具体而言,规划器能够使用自然语言基于当前推理进度规划执行器中下一工具;检查器作为高效内存管理器,协助规划器向特定工具输入恰当视觉信息;最后,因整个推理过程复杂且灵活,设计学习者使模型自主探索并发现最优解。我们在 A-OKVQA 与 NExT-QA 基准上实验,取得 SOTA 结果。此外,展示案例证明了系统处理远复杂于基准问题之能力。
引用
@article{arxiv.2306.08640,
title = {AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn},
author = {Difei Gao and Lei Ji and Luowei Zhou and Kevin Qinghong Lin and Joya Chen and Zihan Fan and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2306.08640},
year = {2023}
}
备注
Project page: https://showlab.github.io/assistgpt/