中文

借助更先进的集群或在亚人类尺度上实现一定程度的图像识别

计算机视觉与模式识别 2023-08-10 v1 机器学习

摘要

本研究的目的是确定当前可用的自监督学习技术能否利用与人类相同的感官输入程度和数量来实现对人类视觉图像的理解水平。该主题的初步研究仅考虑了数据量缩放。在此,我们对数据量和图像质量同时进行缩放。该缩放实验是一种自监督学习方法,无需任何外部资金即可完成。我们发现,同时扩大数据量和图像分辨率能够在亚人类尺度上实现人类水平的物体检测性能。我们开展了一项缩放实验,使用在多达 200000 张图像(最高 256 ppi)上训练的视觉Transformer(vision transformers)。

关键词

引用

@article{arxiv.2308.05092,
  title  = {A degree of image identification at sub-human scales could be possible with more advanced clusters},
  author = {Prateek Y J},
  journal= {arXiv preprint arXiv:2308.05092},
  year   = {2023}
}

备注

6 pages, 5 figures, public code and model: https://github.com/PrateekJannu/imagescale2