中文

TraveLER:面向视频问答的模块化多-LMM智能体框架

计算机视觉与模式识别 2024-10-22 v2 人工智能 计算与语言 机器学习

摘要

最近,基于图像的大型多模态模型(LMM)通过帧级方法在零样图训练方式下取得了显著进展,用于视频问答(VideoQA)。然而,这些模型需要同时能够找到相关信息、提取信息并回答问题。目前,现有方法在单次传递中完成上述所有步骤,无法在信息收集不足或错误时进行调整。为此,我们引入一种基于多个具有不同角色的智能体、由 Planner 智能体指挥并利用其他智能体共享反馈来更新指令的模块化多-LMM 智能体框架。具体而言,我们提出了 TraveLER,一种能够创建遍历视频的计划、针对 individual frames 提问以定位并存储关键信息,然后评估是否存在足够的信息来回答问题的方法。最后,如果信息不足,本方法能够根据收集的知识进行重新规划。通过大量实验,我们发现所提出的 TraveLER 方法在无需针对特定数据集微调的情况下,提升了多个 VideoQA 数据集上的性能。我们的代码已公开于 https://github.com/traveler-framework/TraveLER。

关键词

引用

@article{arxiv.2404.01476,
  title  = {TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering},
  author = {Chuyi Shang and Amos You and Sanjay Subramanian and Trevor Darrell and Roei Herzig},
  journal= {arXiv preprint arXiv:2404.01476},
  year   = {2024}
}

备注

EMNLP 2024 (Main)