MVIP — 面向应用场景的多视角多模态工业部件识别数据集与方法
计算机视觉与模式识别
2025-02-24 v1 人工智能
摘要
我们提出了 MVIP,一个用于多模态和多视角面向应用场景的工业部件识别的数据集。我们首次将校准好的 RGBD 多视角数据集与额外的上下文信息(如物理属性、自然语言和次类)相结合。当前可获得的数据集为设计和基准测试相关方法提供了广泛的表示形式。与现有分类挑战不同,工业识别应用提供受控的多模态环境,同时也具有与传统 2D/3D 分类挑战不同的问题。频繁地,工业应用必须处理少量或增加的训练数据、视觉上相似的部件以及变化的对象尺寸,同时要求在成本和时间约束下实现接近 100% 的 Top-5 准确率。现有方法分别针对这些挑战进行处理,但在工业应用中直接采用这些方法仍然复杂且需要进一步的研究。我们主要的目标是通过 MVIP 研究和推动各种最新方法在相关下游任务中的可移植性,以实现工业分类器的高效部署。此外,我们意图通过 MVIP 推动关于几种模态融合话题(包括自动化合成数据生成和复杂数据采样)的研究,这些内容在单一面向应用的基准中结合在一起。
引用
@article{arxiv.2502.15448,
title = {MVIP -- A Dataset and Methods for Application Oriented Multi-View and Multi-Modal Industrial Part Recognition},
author = {Paul Koch and Marian Schlüter and Jörg Krüger},
journal= {arXiv preprint arXiv:2502.15448},
year = {2025}
}
备注
Accepted to IMPROVE 2025