中文

FALCONEye:基于多模态LLM的finding answers and localizing content in ONE-hour-long videos

计算机视觉与模式识别 2026-01-09 v3

摘要

在时长为一小时的视频中寻找信息是一项具有挑战性的任务,即使对于表现最好的视觉语言模型(VLM)也是如此,因为快速编码视觉内容会超出可用上下文窗口。为解决这一挑战,我们提出FALCONEye,一种基于训练免费、模型无关的元体架构的新型视频智能体,由VLM和大语言模型(LLM)组成。FALCONEye利用由VLM答案置信度校准所驱动的探索式搜索算法回答开放式问题。我们还引入FALCON-Bench基准,将问答问题扩展到视频问答——要求模型返回答案及其支持的时间窗口,以回答一小时视频中的开放式问题。在仅使用7B VLM和轻量级LLM的情况下,FALCONEye在FALCON-Bench中超越了所有开源7B VLM和可比较的智能体。它进一步在MLVU基准上展示了其泛化能力,该基准涉及较短视频和不同任务,在单细节任务中超过GPT-4o,同时将推理成本约降低一个数量级。

关键词

引用

@article{arxiv.2503.19850,
  title  = {FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMs},
  author = {Carlos Plou and Cesar Borja and Ruben Martinez-Cantin and Ana C. Murillo},
  journal= {arXiv preprint arXiv:2503.19850},
  year   = {2026}
}