HySTER:一种混合时空事件推理器
计算机视觉与模式识别
2021-01-19 v1 人工智能
计算与语言
计算机科学中的逻辑
摘要
视频问答(VideoQA)任务包括回答关于视频的自然语言问题,并作为评估模型在场景序列理解方面性能的代理。迄今为止,大多数专为VideoQA设计的方法都是端到端深度学习架构,它们在复杂时间与因果推理上表现吃力,且在推理步骤上提供有限的透明性。我们提出HySTER:一种混合时空事件推理器,用于对视频中的物理事件进行推理。我们的模型利用了深度学习方法的优势从视频帧中提取信息,并结合符号人工智能在答案集编程框架中的推理能力与可解释性。我们定义了一种基于通用时间、因果和物理规则的方法,可跨任务迁移。我们将模型应用于CLEVRER数据集,并展示了在问答准确率上的最先进结果。本工作为归纳逻辑编程在VideoQA领域的引入奠定了基础。
引用
@article{arxiv.2101.06644,
title = {HySTER: A Hybrid Spatio-Temporal Event Reasoner},
author = {Theophile Sautory and Nuri Cingillioglu and Alessandra Russo},
journal= {arXiv preprint arXiv:2101.06644},
year = {2021}
}
备注
Preprint accepted by the 35th AAAI Conference on Artificial Intelligence (AAAI-21) Workshop on Hybrid Artificial Intelligence (HAI)