中文

基于 Agentic Keyframe Search 的视频问答关键帧搜索

计算机视觉与模式识别 2025-03-21 v1

摘要

视频问答(VideoQA)通过自然语言交互从视频中提取和理解关键信息,这是实现人工智能能力的关键步骤。然而,对于视频的深入理解需求以及高计算成本仍限制了 VideoQA 的广泛应用。为此,我们提出了 Agentic Keyframe Search(AKeyS),这是一种简单而强大的算法,用于识别 VideoQA 任务中的关键帧。它能够通过利用现代语言智能体指导经典搜索算法,从而有效地从冗余且无关的内容中区分关键信息。具体而言,我们首先将视频分段并组织为树结构。然后,AKeyS 使用语言智能体估计启发式值和移动成本,同时动态扩展节点。最后,智能体根据终止条件确定是否已收集足够的关键帧并提供答案。在 EgoSchema 和 NExT-QA 数据集上的大规模实验表明,AKeyS 在所有先前方法中均取得最佳关键帧搜索效率,这意味着它能够准确识别关键信息并在最小计算开销下进行有效的视觉推理。例如,在 EgoSchema 数据集子集上,它相较于 VideoTree 在准确率提升 1.8% 的同时仅处理 43.5% 的帧。我们认为 AKeyS 表示了构建用于视频理解的智能代理的重要进展。代码已公开 disponible at https://github.com/fansunqi/AKeyS。

关键词

引用

@article{arxiv.2503.16032,
  title  = {Agentic Keyframe Search for Video Question Answering},
  author = {Sunqi Fan and Meng-Hao Guo and Shuojin Yang},
  journal= {arXiv preprint arXiv:2503.16032},
  year   = {2025}
}