NeuS-QA: 在时间逻辑与神经符号推理中锚定长视频理解
计算机视觉与模式识别
2025-11-17 v2
摘要
虽然视觉语言模型(VLM)在涉及单张图像或短视频的任务上表现出色,但由于需要复杂的多步时间推理,它们在长视频问答(LVQA)方面仍然存在困难。朴素方法简单地均匀采样帧并将它们与问题一起输入VLM,会产生显著的token开销。这迫使对长视频进行激进的降采样,导致模型遗漏细粒度的视觉结构、微妙的事件转换和关键的时间线索。近期工作试图通过启发式方法克服这些限制;然而,它们缺乏编码时间关系的显式机制,也无法提供所采样上下文实际编码了问题所需的组合或因果逻辑的任何形式保证。为了解决这些基础性差距,我们引入了NeuS-QA,一个用于LVQA的无训练、即插即用的神经符号流水线。NeuS-QA首先将自然语言问题转换为建模帧级事件之间时间关系的逻辑规范。接下来,我们构建视频自动机来建模视频逐帧的事件进展,最后利用模型检验将自动机与规范进行比较,以识别满足问题逻辑要求的所有视频片段。只有这些逻辑验证过的片段才会被提交给VLM,从而提高可解释性、减少幻觉,并在不修改或微调模型的情况下实现组合推理。在LongVideoBench和CinePile LVQA基准上的实验表明,NeuS-QA显著提升了性能超过10%,尤其在涉及事件排序、因果关系和多步推理的问题上。我们开源代码于https://utaustin-swarmlab.github.io/NeuS-QA/。
引用
@article{arxiv.2509.18041,
title = {NeuS-QA: Grounding Long-Form Video Understanding in Temporal Logic and Neuro-Symbolic Reasoning},
author = {Sahil Shah and S P Sharan and Harsh Goel and Minkyu Choi and Mustafa Munir and Manvik Pasula and Radu Marculescu and Sandeep Chinchali},
journal= {arXiv preprint arXiv:2509.18041},
year = {2025}
}