中文

MANTA:面向微小物体的多视角视觉-文本异常检测大规模数据集

计算机视觉与模式识别 2024-12-09 v1

摘要

我们提出了 MANTA,一个面向微小物体的视觉-文本异常检测数据集。视觉部分涵盖 38 个物体类别、超过 137.3K 张图像,跨越五个典型领域,其中 8.6K 张图像被标注为异常并带有像素级注释。每张图像从五个不同视角拍摄,以确保对物体的全面覆盖。文本部分由两个子集组成:陈述性知识,包含 875 个描述各领域和特定类别常见异常的词汇,并附有详细的解释,涵盖是什么、为什么和怎么做,包括原因和视觉特征;以及建构性学习,提供 2K 道不同难度级别的选择题,每道题均配有图像和对应的答案解释。我们还提出了一种视觉-文本任务的基线方法,并进行了广泛的基准测试实验,以评估不同设置下先进方法的性能,突出了我们数据集面临的挑战及其有效性。

关键词

引用

@article{arxiv.2412.04867,
  title  = {MANTA: A Large-Scale Multi-View and Visual-Text Anomaly Detection Dataset for Tiny Objects},
  author = {Lei Fan and Dongdong Fan and Zhiguang Hu and Yiwen Ding and Donglin Di and Kai Yi and Maurice Pagnucco and Yang Song},
  journal= {arXiv preprint arXiv:2412.04867},
  year   = {2024}
}

备注

https://grainnet.github.io/MANTA