用于简化视频问答任务的工具增强时空推理
计算机视觉与模式识别
2025-12-12 v1
摘要
视频问答(VideoQA)任务是评估基础模型是否能够有效感知、理解和推理动态真实场景的关键场所。然而,现有多模态大语言模型(MLLM)在处理VideoQA任务时,难以同时建模视频帧内的空间关系以及理解复杂且推理密集场景的时空演化因果动态。为此,我们为MLLM配备了全面且可扩展的视频工具套件,以增强其时空推理能力,确保工具数量与多样性之间的和谐。为更好地控制工具调用序列,避免工具链捷径问题,我们提出时空推理框架(STAR),该框架战略性地安排时序与空间工具,从而逐步定位视频中的关键区域。我们的STAR框架通过轻量级工具提升GPT-4o的性能,在VideoMME上实现8.2%的提升,在LongVideoBench上实现4.6%的提升。我们认为,所提出的视频工具套件和STAR框架是构建自主智能视频分析助手的重要一步。代码已公开发布于https://github.com/fansunqi/VideoTool。
引用
@article{arxiv.2512.10359,
title = {Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task},
author = {Sunqi Fan and Jiashuo Cui and Meng-Hao Guo and Shuojin Yang},
journal= {arXiv preprint arXiv:2512.10359},
year = {2025}
}
备注
Accepted by NeurIPS 2025 main track