单视图真实世界点云的食品杂货基准数据集
计算机视觉与模式识别
2024-04-09 v2
摘要
细粒度食品杂货物体识别是一个重要的计算机视觉问题,在自动结账、店内机器人导航以及视障人士辅助技术方面有着广泛的应用。现有的食品杂货数据集主要是二维图像。在这些数据集上训练的模型仅限于从规则二维网格中学习特征。虽然 Kinect 等便携式 3D 传感器曾普遍用于手机,但 LiDAR 和 TrueDepth 等传感器最近已集成到手机中。尽管移动 3D 传感器可用,但目前尚无专用的真实世界大规模食品杂货 3D 基准数据集。此外,现有的 3D 数据集缺乏细粒度的食品杂货类别,且训练样本有限。此外,与传统照片拍摄相比,围绕物体收集数据使得数据采集变得繁琐。因此,我们引入了一个名为 3DGrocery100 的大规模食品杂货数据集。它包含 100 个类别,总共由 10,755 张 RGB-D 单视图图像创建的 87,898 个 3D 点云组成。我们在六个最新的 3D 点云分类模型上对该数据集进行了基准测试。此外,我们还在少样本和持续学习点云分类任务上对该数据集进行了基准测试。项目页面:https://bigdatavision.org/3DGrocery100/。
引用
@article{arxiv.2402.07819,
title = {A Benchmark Grocery Dataset of Realworld Point Clouds From Single View},
author = {Shivanand Venkanna Sheshappanavar and Tejas Anvekar and Shivanand Kundargi and Yufan Wang and Chandra Kambhamettu},
journal= {arXiv preprint arXiv:2402.07819},
year = {2024}
}