自动驾驶中的常识性视觉理解:基于融合视觉与语义的广义神经符号在线溯因
人工智能
2020-12-29 v1 计算机视觉与模式识别
机器学习
机器人学
摘要
我们在自动驾驶背景下论证了系统性融合视觉与语义解决方案对于视觉理解的必要性与潜力。本文系统性形式化并完整实现了一种使用答案集编程(ASP)的在线视觉理解通用神经符号方法。该方法融合了视觉计算的最新进展,并作为一个模块化框架开发,可在用于实时感知与控制的混合架构中普遍使用。我们使用社区公认的基准 KITTIMOD、MOT-2017 和 MOT-2020 进行评估与演示。作为用例,我们聚焦于以人为中心的视觉理解——例如涉及语义表示与可解释性、问答、常识插值——在安全性关键的自动驾驶情境中的意义。所开发的神经符号框架与领域无关,以自动驾驶为案例,旨在作为在选定以人为中心的人工智能技术设计考量背景下,多样化认知交互情境中在线视觉理解的范例。关键词:认知视觉、深度语义、声明式空间推理、知识表示与推理、常识推理、视觉溯因、答案集编程、自动驾驶、以人为中心的计算与设计、驾驶技术标准化、空间认知与人工智能。
引用
@article{arxiv.2012.14359,
title = {Commonsense Visual Sensemaking for Autonomous Driving: On Generalised Neurosymbolic Online Abduction Integrating Vision and Semantics},
author = {Jakob Suchan and Mehul Bhatt and Srikrishna Varadarajan},
journal= {arXiv preprint arXiv:2012.14359},
year = {2020}
}
备注
This is a preprint / review version of an accepted contribution to be published as part of the Artificial Intelligence Journal (AIJ).? The article is an extended version of an IJCAI 2019 publication [74, arXiv:1906.00107]