中文

AHA —— 预测下一步要关注的内容:无需事前观看的在线高亮检测

计算机视觉与模式识别 2025-09-26 v2 人工智能

摘要

实时理解连续视频流对于高风险环境中的智能体至关重要,包括自动驾驶汽车、监视无人机和灾难响应机器人。然而,大多数现有视频理解和高亮检测方法在推理时假设能够访问整个视频,因而不适用于在线或流式场景。特别是,当前模型针对离线摘要进行优化,无法支持实时决策所需的逐步推理。我们提出Aha(Autoregressive Highlight detection framework),一种基于自回归的高亮检测框架,通过自然语言描述的任务预测每个视频帧的相关性。无需访问未来的视频帧,Aha利用多模态视觉语言模型和轻量级、解耦的头部结构,在大型、精选的人类导向视频标签数据集上进行训练。为实现可扩展性,我们引入Dynamic SinkCache机制,实现跨无限长度流的恒定内存使用,而不会在标准基准测试上产生性能下降。这鼓励隐藏表示捕获高层次任务目标,从而在信息性、相关性和不确定性方面相对于自然语言任务实现有效的帧级排序。Aha在高亮检测基准测试中实现了状态最佳(SOTA)性能,在TVSum上 surpassing even prior offline, full-context approaches and video-language models by +5.9% in mAP (mean Average Precision),在Mr. Hisum上提升+8.3%。我们探讨了Aha在实际机器人应用中的潜力,结合以任务为导向的自然语言输入和连续、机器人导向的视频。所有实验均表明Aha作为下游规划和长期理解的实时推理模块具有潜在的有效性。

关键词

引用

@article{arxiv.2509.16421,
  title  = {AHA -- Predicting What Matters Next: Online Highlight Detection Without Looking Ahead},
  author = {Aiden Chang and Celso De Melo and Stephanie M. Lukin},
  journal= {arXiv preprint arXiv:2509.16421},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025, 32 pages, 5 figures