中文

不仅仅是鸟类和汽车:面向专业视觉识别的通用、可扩展且可解释的模型

计算机视觉与模式识别 2024-03-12 v1

摘要

一些视觉识别任务比一般任务更具挑战性,因为它们需要专业的图像类别。以往的工作,如细粒度视觉分类,主要引入针对特定任务定制的模型,例如识别鸟类物种或汽车品牌,其可扩展性和泛化性有限。本文旨在从通用角度设计一个可扩展且可解释的模型来解决专业视觉识别任务。我们引入了一种受生物学启发的结构,命名为 Pro-NeXt,并揭示了 Pro-NeXt 在时尚、医学和艺术等不同的专业领域表现出显著的泛化能力,而这些领域以前被认为是互不相关的。我们的基础尺寸 Pro-NeXt-B 在 5 个不同领域的 12 个不同数据集上超越了所有先前的特定任务模型。此外,我们发现了其良好的缩放特性,即通过增加 GFlops 在深度和宽度上扩展 Pro-NeXt 可以持续提高其准确性。除了可扩展性和适应性之外,Pro-NeXt 的中间特征无需额外训练即可实现可靠的目标检测和分割性能,突出了其坚实的可解释性。我们将发布代码以促进该领域的进一步研究。

关键词

引用

@article{arxiv.2403.05703,
  title  = {Not just Birds and Cars: Generic, Scalable and Explainable Models for Professional Visual Recognition},
  author = {Junde Wu and Jiayuan Zhu and Min Xu and Yueming Jin},
  journal= {arXiv preprint arXiv:2403.05703},
  year   = {2024}
}

备注

20 pages including reference. arXiv admin note: text overlap with arXiv:2211.15672