ViQAgent:基于开放词汇定位验证的智能体零样本视频问答
计算机视觉与模式识别
2025-05-23 v1 计算与语言
摘要
视频问答(VideoQA)领域的最新进展引入了基于大语言模型(LLM)的智能体、模块化框架和程序化解决方案,取得了令人鼓舞的成果。这些系统使用动态智能体和基于记忆的机制来分解复杂任务并优化答案。然而,在随时间推移跟踪对象以进行定位以及基于推理进行决策以更好地将对象引用与语言模型输出对齐方面,仍有显著的改进空间,因为更新的模型在这两项任务上都变得更强。本文提出了一种用于零样本视频问答(VideoQA)的LLM大脑智能体,它将思维链框架与定位推理以及YOLO-World相结合,以增强对象跟踪和对齐。该方法在视频问答和视频理解方面建立了新的最先进水平,在NExT-QA、iVQA和ActivityNet-QA基准测试上表现出增强的性能。我们的框架还支持对定位时间帧进行交叉检查,提高了准确性,并为跨多个视频领域的验证和输出可靠性提升提供了宝贵支持。代码可在https://github.com/t-montes/viqagent获取。
引用
@article{arxiv.2505.15928,
title = {ViQAgent: Zero-Shot Video Question Answering via Agent with Open-Vocabulary Grounding Validation},
author = {Tony Montes and Fernando Lozano},
journal= {arXiv preprint arXiv:2505.15928},
year = {2025}
}