Em-Garde:面向主动式流式视频理解的提议-匹配框架
计算机视觉与模式识别
2026-03-20 v1 人工智能
摘要
近期在流式视频理解方面的进展已启用一种新型交互范式,其中模型对用户查询主动作出响应。当前的主动式 VideoLLM 依赖逐帧触发决策,受制于效率-准确性困境。我们提出了 Em-Garde,一个新型框架,将语义理解与流式感知解耦。在查询时,Instruction-Guided Proposal Parser 将用户查询转换为结构化的、感知上有 grounding 的视觉提议;在流式过程中,轻量级提议匹配模块执行高效的基于嵌入的匹配,以触发响应。在 StreamingBench 和 OVO-Bench 上的实验表明,Em-Garde 在主动响应准确性和效率方面 consistently 超过先前模型,验证了一个在严格计算约束下实现主动视频理解的有效解决方案。
引用
@article{arxiv.2603.19054,
title = {Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding},
author = {Yikai Zheng and Xin Ding and Yifan Yang and Shiqi Jiang and Hao Wu and Qianxi Zhang and Weijun Wang and Ting Cao and Yunxin Liu},
journal= {arXiv preprint arXiv:2603.19054},
year = {2026}
}