将查询分解为工具调用以用于长视频关键帧检索
计算机视觉与模式识别
2026-05-25 v1 计算与语言
摘要
关键帧选择是为长视频问答 (QA) 提供可验证视觉证据的直接方式。查询的需求各不相同, 找到正确的帧取决于知道要寻找什么。现有的关键帧选择器要么针对单一查询对每一帧进行评分, 要么将查询分解为由单一视觉工具评估的固定模式。我们提出了 ToolMerge, 一种基于分解与合并的关键帧检索方法: 一个基于大型语言模型 (LLM) 的规划器将查询分解为工具调用, 并指定如何使用布尔运算符合并各工具的排名。为了直接评估检索效果, 我们构建了 Molmo-2 Moments (M2M), 这是一个通过构造将每个问题锚定到特定时间区间的基准测试。在 QA、问题检索和字幕检索中, ToolMerge 与先前的关键帧选择器具有竞争力, 最显著的是在字幕检索上比其他方法高出 5%。代码和数据可在 https://github.com/michalsr/ToolMerge 找到。
引用
@article{arxiv.2605.23826,
title = {Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval},
author = {Michal Shlapentokh-Rothman and Prachi Garg and Yu-Xiong Wang and Derek Hoiem},
journal= {arXiv preprint arXiv:2605.23826},
year = {2026}
}