中文

HySTER:一种混合时空事件推理器

计算机视觉与模式识别 2021-01-19 v1 人工智能 计算与语言 计算机科学中的逻辑

摘要

视频问答(VideoQA)任务包括回答关于视频的自然语言问题,并作为评估模型在场景序列理解方面性能的代理。迄今为止,大多数专为VideoQA设计的方法都是端到端深度学习架构,它们在复杂时间与因果推理上表现吃力,且在推理步骤上提供有限的透明性。我们提出HySTER:一种混合时空事件推理器,用于对视频中的物理事件进行推理。我们的模型利用了深度学习方法的优势从视频帧中提取信息,并结合符号人工智能在答案集编程框架中的推理能力与可解释性。我们定义了一种基于通用时间、因果和物理规则的方法,可跨任务迁移。我们将模型应用于CLEVRER数据集,并展示了在问答准确率上的最先进结果。本工作为归纳逻辑编程在VideoQA领域的引入奠定了基础。

关键词

引用

@article{arxiv.2101.06644,
  title  = {HySTER: A Hybrid Spatio-Temporal Event Reasoner},
  author = {Theophile Sautory and Nuri Cingillioglu and Alessandra Russo},
  journal= {arXiv preprint arXiv:2101.06644},
  year   = {2021}
}

备注

Preprint accepted by the 35th AAAI Conference on Artificial Intelligence (AAAI-21) Workshop on Hybrid Artificial Intelligence (HAI)