中文

LE-NeuS:基于自适应时序验证的延迟高效神经符号视频理解

计算机视觉与模式识别 2026-03-02 v1

摘要

神经符号方法已在长篇视频问答(LVQA)中显著提升准确率,通过在形式化验证中实现时序推理。然而,现有方法导致高达 90 倍的延迟开销,远低于基础 VLM 提示,难以满足面向边缘部署的延迟敏感场景。我们提出 LE-NeuS,一种延迟高效的神经符号框架,保留时序逻辑引导的视频理解准确性优势,同时大幅降低推理延迟。我们的关键洞察是,自动机构造过程中基于视频帧的顺序稠密命题检测是计算瓶颈。我们通过两个原则化优化措施实现:(1) 基于 CLIP 的两阶段自适应抽样,利用视觉冗余性跳过语义相似的帧,同时保留时序边界;(2) 批处理命题检测,对时序窗口进行并行 VLM 推理。理论上,我们推导了视频长度、命题复杂度和抽样密度下延迟效率的界限,建立了延迟效率可实现的条件。实证上,在LongVideoBench 和 Video-MME 基准测试部署于 NVIDIA H100 GPU 上,LE-NeuS 将延迟差距从 90 倍降至约 10 倍,同时在时序复杂查询上保持超过 10% 的准确率提升。

关键词

引用

@article{arxiv.2602.23553,
  title  = {LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification},
  author = {Shawn Liang and Sahil Shah and Chengwei Zhou and SP Sharan and Harsh Goel and Arnab Sanyal and Sandeep Chinchali and Gourav Datta},
  journal= {arXiv preprint arXiv:2602.23553},
  year   = {2026}
}

备注

Under review