中文

基于事件图的视频问答可解释推理系统 ENTER

计算机视觉与模式识别 2026-04-08 v2 人工智能

摘要

本文提出了 ENTER,一个基于事件图的可解释视频问答 (VideoQA) 系统。事件图将视频转换为图形表示,其中视频事件构成节点,事件-事件关系(时间/因果/层次)构成边。这种结构化表示带来诸多好处:1) 通过生成解析事件图的代码实现可解释视频问答;2) 在推理过程中融合上下文视觉信息(代码生成);3) 通过层次化迭代更新事件图实现鲁棒视频问答。现有可解释视频问答系统往往采用自上而下的方法,忽视推理计划生成中的低级视觉信息,且脆弱。而自下而下的方法则从视觉数据中生成响应,但缺乏可解释性。在 NExT-QA、IntentQA 和 EgoSchema 等数据集上的实验表明,我们的方法不仅超越了现有自上而下方法,获得了对自下而下方法的有竞争力的性能,更重要的是,在推理过程中提供了卓越的可解释性和可解释性。

关键词

引用

@article{arxiv.2501.14194,
  title  = {ENTER: Event Based Interpretable Reasoning for VideoQA},
  author = {Hammad Ayyubi and Junzhang Liu and Ali Asgarov and Zaber Ibn Abdul Hakim and Najibul Haque Sarker and Zhecan Wang and Chia-Wei Tang and Hani Alomari and Md. Atabuzzaman and Xudong Lin and Naveen Reddy Dyava and Shih-Fu Chang and Chris Thomas},
  journal= {arXiv preprint arXiv:2501.14194},
  year   = {2026}
}