Eyes Wide Open: 面向流式视频的自我主动视频-LLM
计算机视觉与模式识别
2025-10-17 v1
摘要
设想一种能够在类似人类环境中运行的AI,超越单纯的观察,主动理解、预测并主动响应正在发生的事件。朝着这一愿景,我们专注于一项创新任务:给定自我流式视频输入,助手在适当时机主动回答多样、不断演变的问题,同时保持同步的感知和推理。该任务体现了三个关键特性:(1) 主动连贯性,(2) 即时响应性,以及(3) 同步效率。为了评估和解决这些特性,我们首先引入了ESTP-Bench(自我流式主动基准)以及ESTP-F1指标——一个旨在严格评估它们的新颖框架。其次,我们提出了一个全面的技术流程,使模型能够应对这一具有挑战性的任务。该流程包括:(1) 数据引擎,(2) 多阶段训练策略,以及(3) 主动动态压缩技术。我们提出的模型有效解决了这些关键特性,同时在多个在线和离线基准测试中优于多个基线。项目页面:https://zhangyl4.github.io/publications/eyes-wide-open/
引用
@article{arxiv.2510.14560,
title = {Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video},
author = {Yulin Zhang and Cheng Shi and Yang Wang and Sibei Yang},
journal= {arXiv preprint arXiv:2510.14560},
year = {2025}
}
备注
Accepted at NeurIPS 2025 (preview; camera-ready in preparation)