基于递归工具使用的数据视频智能体 with Meta-Augmented Tool Grounding
计算机视觉与模式识别
2026-05-14 v1 人工智能
摘要
视频理解需要主动寻找证据,动机是为进行时间推理、跨模态理解和复杂问答而构建工具增强型视频智能体。现有的视频智能体通过检索、记忆、帧检查和验证器工具等手段提高了视频推理能力,但仍面临两个局限性:(1) 工具空间粗糙,缺乏用于组合推理的细粒度操作;(2) 动作空间为平坦,迫使高层视频意图强行转化为原始可执行工具调用。在本文中,我们通过两种互补的设计来解决这些挑战。首先,我们构建了 MetaAug-Video Tool Library(MVTL),一个可扩展的工具库,包含 134 个已注册工具,其中 26 个通用多模态信号处理的基础工具,以及 108 个用于过滤、聚合、重排序、格式化和其他中间结果操作的 meta 工具。MVTL 支持对结构化视频信息和原始模态证据的双层访问,支持多样化的视频推理场景。其次,我们提出了 ReTool-Video,一种递归工具使用方法,用于将高层视频意图 grounding 到可执行的工具链。在 ReTool-Video 中,匹配的动作直接执行,而不匹配的意图则委托给解析器进行参数修复、工具替换或分解。这使得诸如时间合并、跨模态验证或重复事件聚合等抽象动作能够在运行时逐步转化为具体的多模态操作。实验在 MVBench、MLVU 和 Video-MME w/o sub. 上显示,ReTool-Video 在所有基准上都一致优于强大的基线方法。进一步分析表明,递归 grounding 和细粒度 meta 工具提高了复杂视频理解的稳定性和有效性。
引用
@article{arxiv.2605.13228,
title = {ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding},
author = {Xiao Liu and Nayu Liu and Junnan Zhu and Ruirui Chen and Guohui Xiang and Changjian Wang and Kaiwen Wei and Rongzhen Li and Jiang Zhong},
journal= {arXiv preprint arXiv:2605.13228},
year = {2026}
}