中文

迭代补丁选择在内存高效高分辨率图像分类中的可推广性研究

计算机视觉与模式识别 2024-12-17 v1

摘要

由于计算和内存限制,对大图像进行小或微小兴趣区域(ROI)的分类具有挑战性。弱监督的内存高效补丁选择器已取得与强监督方法相当的效果。然而,低信噪比和低熵注意力仍导致过拟合。我们在以迭代补丁选择(IPS)作为补丁选择模块的内存高效跨注意力变换器上进行新建模测试。该测试将megapixel MNIST基准扩展到四个更小的O2I(object-to-image)比例,范围为0.01%至0.14%,保持画布大小不变,并引入基于Bézier曲线的噪声生成组件。实验结果将CNN上的观察推广到IPS,其中O2I阈值影响分类器是否可推广的临界值受训练数据集大小的影响。我们进一步观察到,这种相互作用的大小在Megapixel MNIST的每个任务中都有所不同。对于任务"Maj"和"Top",该率最高,随后是任务"Max"和"Multi",后者该率几乎为0。结果表明,在数据有限的情况下,将补丁大小调小以相对于ROI improve可推广性,使megapixel MNIST提升+15%,瑞典交通标志数据集提升+5%。进一步的结果表明,噪声组件厚度与megapixel MNIST中数字的相似度会逐渐导致IPS无法可推广,助长了此前的怀疑。

关键词

引用

@article{arxiv.2412.11237,
  title  = {On the Generalizability of Iterative Patch Selection for Memory-Efficient High-Resolution Image Classification},
  author = {Max Riffi-Aslett and Christina Fell},
  journal= {arXiv preprint arXiv:2412.11237},
  year   = {2024}
}

备注

15 pages, submitted to Springer Nature, International Journal of Computer Vision