V-LoL:一个用于视觉逻辑学习的诊断数据集
人工智能
2024-11-14 v3 计算机视觉与模式识别
机器学习
摘要
尽管视觉 AI 近期发展取得了成功,仍存在不同的缺陷:从缺乏精确逻辑推理,到抽象泛化能力,再到理解复杂且含噪的场景。遗憾的是,现有基准并未被设计用于捕捉这些方面中的超过少数几个。深度学习的 dataset 侧重于视觉上复杂的数据但简单的视觉推理任务,而归纳逻辑数据集涉及复杂的逻辑学习任务,却缺乏视觉组件。为此,我们提出了诊断性视觉逻辑学习数据集 V-LoL,其无缝结合了视觉与逻辑挑战。值得注意的是,我们引入了 V-LoL 的首个实例 V-LoL-Train——经典符号 AI 基准 Michalski 列车问题的视觉呈现。通过在通用框架中融入精细的视觉场景与灵活的逻辑推理任务,V-LoL-Train 为研究广泛的视觉逻辑学习挑战提供了平台。我们评估了多种 AI 系统,包括传统符号 AI、神经 AI 以及神经符号 AI。我们的评估表明,即便是 SOTA AI 在处理视觉逻辑学习挑战时也面临困难,凸显了每种方法的独特优势与局限。总体而言,V-LoL 为理解和增强 AI 系统在视觉逻辑学习方面的现有能力开辟了新途径。
引用
@article{arxiv.2306.07743,
title = {V-LoL: A Diagnostic Dataset for Visual Logical Learning},
author = {Lukas Helff and Wolfgang Stammer and Hikaru Shindo and Devendra Singh Dhami and Kristian Kersting},
journal= {arXiv preprint arXiv:2306.07743},
year = {2024}
}