中文

基于 Bloom 过滤器的快速 Coreset 采样用于细粒度自监督学习

计算机视觉与模式识别 2024-12-24 v1

摘要

深度学习在监督式细粒度识别中取得成功,很大程度上依赖于专业注释。在细粒度自监督学习 (SSL) 的开放集问题中,旨在通过战略性地从大型无标签数据集(开放集)中精选出子集(核心集)来提高下游任务的性能。本文提出一种新方法 BloomCoreset,可显著减少从开放集中采样时间,同时保持核心集中样本的质量。为实现此目标,我们将 Bloom 过滤器作为一种创新的哈希机制,用于存储细粒度数据集的低级和高级特征,这些特征由 Open-CLIP 提取,采用空间效率高的方式存储,从而 enables rapid retrieval of the coreset from the Open-Set。为展示所选核心集的有效性,我们将所提方法集成到最先进的细粒度 SSL 框架 SimCore [1] 中。该算法在 SimCore [1] 的采样策略方面性能大幅提升,采样时间降低 98.5%98.5\%,仅以 0.83%0.83\% 的平均准确率牺牲,跨越 1111 个下游数据集进行测试。

关键词

引用

@article{arxiv.2412.16942,
  title  = {BloomCoreset: Fast Coreset Sampling using Bloom Filters for Fine-Grained Self-Supervised Learning},
  author = {Prajwal Singh and Gautam Vashishtha and Indra Deep Mastan and Shanmuganathan Raman},
  journal= {arXiv preprint arXiv:2412.16942},
  year   = {2024}
}

备注

Accepted at ICASSP 2025