作为分面分类的视觉真值构建
计算机视觉与模式识别
2022-02-18 v1 人工智能
摘要
机器学习与计算机视觉领域近期的研究表明,主流物体识别基准数据集在开发过程中存在系统性设计缺陷。其中一个例子是 ImageNet,其中对于若干类图像,其所表征的物体与用于标注它们的标签之间存在不一致。该问题的后果十分严重,尤其考虑到有大量机器学习应用(尤其是那些基于深度神经网络的应用)是在这些数据集上训练的。在本文中,我们认为该问题的根源在于缺乏一种知识表示(KR)方法论,以为这些真值基准数据集的构建提供基础。为此,我们提出一个分为三个主要步骤的解决方案:(i)基于目的语义学(teleosemantics)哲学理论,将物体识别过程解构为四个有序阶段;(ii)基于此种分层,提出一种新颖的四阶段方法论,依据物体的视觉属性将其组织于分类层级中;(iii)按照分面分类(faceted classification)范式执行该分类。我们方法的关键新颖性在于:我们利用视觉属差(visual genus-differentiae)从视觉属性出发构建分类层级,而非从语言 grounded 的属性出发。所提方法通过在 ImageNet 音乐实验层级上的一组实验得到验证。
引用
@article{arxiv.2202.08512,
title = {Visual Ground Truth Construction as Faceted Classification},
author = {Fausto Giunchiglia and Mayukh Bagchi and Xiaolei Diao},
journal= {arXiv preprint arXiv:2202.08512},
year = {2022}
}