基于事件图的视频问答可解释推理系统 ENTER
计算机视觉与模式识别
2026-04-08 v2 人工智能
摘要
本文提出了 ENTER,一个基于事件图的可解释视频问答 (VideoQA) 系统。事件图将视频转换为图形表示,其中视频事件构成节点,事件-事件关系(时间/因果/层次)构成边。这种结构化表示带来诸多好处:1) 通过生成解析事件图的代码实现可解释视频问答;2) 在推理过程中融合上下文视觉信息(代码生成);3) 通过层次化迭代更新事件图实现鲁棒视频问答。现有可解释视频问答系统往往采用自上而下的方法,忽视推理计划生成中的低级视觉信息,且脆弱。而自下而下的方法则从视觉数据中生成响应,但缺乏可解释性。在 NExT-QA、IntentQA 和 EgoSchema 等数据集上的实验表明,我们的方法不仅超越了现有自上而下方法,获得了对自下而下方法的有竞争力的性能,更重要的是,在推理过程中提供了卓越的可解释性和可解释性。
引用
@article{arxiv.2501.14194,
title = {ENTER: Event Based Interpretable Reasoning for VideoQA},
author = {Hammad Ayyubi and Junzhang Liu and Ali Asgarov and Zaber Ibn Abdul Hakim and Najibul Haque Sarker and Zhecan Wang and Chia-Wei Tang and Hani Alomari and Md. Atabuzzaman and Xudong Lin and Naveen Reddy Dyava and Shih-Fu Chang and Chris Thomas},
journal= {arXiv preprint arXiv:2501.14194},
year = {2026}
}