中文

面向视觉问答的神经符号 ASP 流水线

人工智能 2022-05-17 v1 计算机视觉与模式识别

摘要

我们提出了一种用于 CLEVR 的神经符号视觉问答(VQA)流水线,CLEVR 是一个著名的数据集,包含展示带有物体的场景的图片以及与之相关的问题。我们的流水线包括:(i)训练神经网络以对 CLEVR 场景进行物体分类和边界框预测;(ii)对神经网络预测值的分布进行统计分析,以确定高置信度预测的阈值;(iii)将 CLEVR 问题及通过置信度阈值的网络预测翻译为逻辑程序,从而可使用 ASP 求解器计算答案。通过利用选择规则,我们考虑了确定性与非确定性的场景编码。我们的实验表明,与确定性方法相比,即使神经网络训练得相当差,非确定性场景编码仍能取得良好结果。这对于在网络预测不够完美时构建鲁棒的 VQA 系统十分重要。此外,我们表明,将非确定性限制于合理选择之中,与相关的神经符号方法相比,可在不损失太多精度的情况下实现更高效的实现。本工作正在考虑被 TPLP 接收。

关键词

引用

@article{arxiv.2205.07548,
  title  = {A Neuro-Symbolic ASP Pipeline for Visual Question Answering},
  author = {Thomas Eiter and Nelson Higuera and Johannes Oetsch and Michael Pritz},
  journal= {arXiv preprint arXiv:2205.07548},
  year   = {2022}
}

备注

Paper presented at the 38th International Conference on Logic Programming (ICLP 2022), 15 pages