中文

链式反应:基于因果链引导的模块化可解释因果-为何视频问答

计算机视觉与模式识别 2025-12-25 v2 人工智能 计算与语言 人机交互 机器学习

摘要

现有的因果-为何视频问答(VideoQA)模型往往难以处理高阶推理,依赖不透明的单一管道将视频理解、因果推断和答案生成交织在一起。这些黑箱方法的可解释性有限,往往依赖浅层启发式。我们提出一种新范式,显式地将因果推理与答案生成解耦,引入自然语言因果链作为可解释的中间表示。受人类认知模型的启发,这些结构化的因果-因果序列桥接了低层视频内容与高层因果推理,实现透明且逻辑连贯的推理。我们的两阶段架构包括从视频-问题对生成因果链的因果链提取器(Causal Chain Extractor, CCE),以及基于这些因果链推导答案的因果链驱动答案生成器(Causal Chain-Driven Answerer, CCDA)。为解决缺乏标注推理痕迹的问题,我们引入一种可扩展的方法,从现有数据集中生成准确的因果链。我们为46,000个样本构建了经过人工验证的因果链。我们还提出了一种用于因果导向描述的新评估指标CauCo。在三个大规模基准测试上进行的实验表明,我们的方法不仅超越了最先进的模型,还在可解释性、用户信任和泛化能力方面获得了显著提升——将CCE定位为跨域通用的因果推理引擎。项目页面:https://paritoshparmar.github.io/chainreaction/

关键词

引用

@article{arxiv.2508.21010,
  title  = {ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering},
  author = {Paritosh Parmar and Eric Peh and Basura Fernando},
  journal= {arXiv preprint arXiv:2508.21010},
  year   = {2025}
}

备注

Project page: https://paritoshparmar.github.io/chainreaction/