AURA:基于视频流的始终在线理解与实时辅助
计算机视觉与模式识别
2026-04-07 v1
摘要
视频大型语言模型(VideoLLMs)在许多视频理解任务上取得了强大的性能,但大多数现有系统是离线的,尚不适用于需要持续观察和及时响应的实时视频流。最近的流式VideoLLMs虽已取得进展,但当前方法往往依赖解耦的触发-响应管道,或仅限于描述性叙述,降低了对开放式问答和长期视互动的有效性。我们提出AURA(Always-On Understanding and Real-Time Assistance),一个端到端的流式视觉交互框架,使统一的VideoLLM能够持续处理视频流并支持实时问答和主动响应。AURA集成了上下文管理、数据构建、训练目标和部署优化,以实现稳定的长期流式交互。它在流式基准测试上实现了最佳性能,并支持一个在两个80G加速器上以2 FPS运行的实时演示系统,集成了ASR和TTS。我们发布了AURA模型及其实时推理框架,以促进未来研究。
引用
@article{arxiv.2604.04184,
title = {AURA: Always-On Understanding and Real-Time Assistance via Video Streams},
author = {Xudong Lu and Yang Bo and Jinpeng Chen and Shuhan Li and Xintong Guo and Huankang Guan and Fang Liu and Dunyuan Xu and Peiwen Sun and Heyang Sun and Rui Liu and Hongsheng Li},
journal= {arXiv preprint arXiv:2604.04184},
year = {2026}
}