DoraemonGPT:利用大语言模型理解动态场景(以视频代理为例)
计算机视觉与模式识别
2025-03-07 v4 计算与语言
摘要
近期由大语言模型驱动的视觉代理主要聚焦于解决基于图像的任务,这限制了它们理解动态场景的能力,使其远未达到实际应用(如指导学生进行实验并识别其错误)的要求。因此,本文探索了DoraemonGPT,一个由大语言模型驱动的、全面且概念优雅的系统,用于理解动态场景。考虑到视频模态能更好地反映真实世界场景的不断变化特性,我们将DoraemonGPT作为视频代理进行实例化。给定一个带有问题/任务的视频,DoraemonGPT首先将输入视频转换为存储任务相关属性的符号记忆。这种结构化表示允许通过精心设计的子任务工具进行时空查询和推理,从而产生简洁的中间结果。认识到大语言模型在专业领域(例如,分析实验背后的科学原理)内部知识有限,我们引入了即插即用工具来评估外部知识并处理跨不同领域的任务。此外,引入了一种基于蒙特卡洛树搜索的新型大语言模型驱动规划器,以探索调度各种工具的大规划空间。该规划器通过反向传播结果的奖励迭代地寻找可行解,并且多个解可以总结为改进的最终答案。我们在三个基准测试和几个野外场景中广泛评估了DoraemonGPT的有效性。代码将在https://github.com/z-x-yang/DoraemonGPT发布。
引用
@article{arxiv.2401.08392,
title = {DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)},
author = {Zongxin Yang and Guikun Chen and Xiaodi Li and Wenguan Wang and Yi Yang},
journal= {arXiv preprint arXiv:2401.08392},
year = {2025}
}