大规模多视角 RGBD 视觉可供性学习数据集
计算机视觉与模式识别
2023-09-14 v3 人工智能
摘要
物体的物理与纹理属性已在计算机视觉的识别、检测与分割任务中被广泛研究。诸多数据集(如大规模 ImageNet)已被提出,用于数据饥渴的深度神经网络的特征学习以及手工特征提取。为与物体智能交互,机器人与智能机器需具备超越传统物理/纹理属性的推断能力,并理解/学习称为视觉可供性(visual affordances)的视觉线索,以用于可供性识别、检测与分割。迄今尚无公开的大规模视觉可供性理解与学习数据集。本文引入一个大规模多视角 RGBD 视觉可供性学习数据集,包含来自 37 个物体类别的 47210 张 RGBD 图像基准,标注有 15 个视觉可供性类别。据我们所知,这是首个且最大的多视角 RGBD 视觉可供性学习数据集。我们使用流行的 Vision Transformer 与卷积神经网络(CNNs)在所提数据集上针对可供性分割与识别任务进行基准测试。若干 SOTA 深度学习网络分别针对可供性识别与分割任务进行了评估。实验结果展示了该数据集的挑战性,并为新颖且鲁棒的可供性学习算法提供了明确前景。数据集公开于 https://sites.google.com/view/afaqshah/dataset。
引用
@article{arxiv.2203.14092,
title = {A large scale multi-view RGBD visual affordance learning dataset},
author = {Zeyad Khalifa and Syed Afaq Ali Shah},
journal= {arXiv preprint arXiv:2203.14092},
year = {2023}
}