VALUED——视觉与逻辑理解评测数据集
计算机视觉与模式识别
2024-08-02 v2 人工智能
摘要
从计算机视觉任务的早期成功开始,基于深度学习的技术已在众多领域超越最先进方法。然而,反复证明这些技术未能捕捉语义上下文与逻辑约束,反而常依赖虚假关联得出答案。由于深度学习技术在关键场景中的应用依赖于对领域特定约束的遵守,已有若干尝试解决该问题。阻碍此领域深入探索的一个局限是缺乏具备丰富规则集的合适数据集。为此,我们提出VALUE(视觉与逻辑理解评测)数据集,包含200,000张标注图像及基于流行棋盘游戏——国际象棋的关联规则集。所策划的规则集显著约束了允许预测的集合,并旨在探查定位与计数等关键语义能力。除标准指标外,还给出衡量逻辑一致性表现的附加指标。我们在该任务上分析了若干流行及最先进的视觉模型,表明尽管其在标准指标上表现可喜,却产生大量不连贯结果,意味着该数据集对未来的研究构成重大挑战。
引用
@article{arxiv.2311.12610,
title = {VALUED -- Vision and Logical Understanding Evaluation Dataset},
author = {Soumadeep Saha and Saptarshi Saha and Utpal Garain},
journal= {arXiv preprint arXiv:2311.12610},
year = {2024}
}