基于 Bloom 过滤器的快速 Coreset 采样用于细粒度自监督学习
计算机视觉与模式识别
2024-12-24 v1
摘要
深度学习在监督式细粒度识别中取得成功,很大程度上依赖于专业注释。在细粒度自监督学习 (SSL) 的开放集问题中,旨在通过战略性地从大型无标签数据集(开放集)中精选出子集(核心集)来提高下游任务的性能。本文提出一种新方法 BloomCoreset,可显著减少从开放集中采样时间,同时保持核心集中样本的质量。为实现此目标,我们将 Bloom 过滤器作为一种创新的哈希机制,用于存储细粒度数据集的低级和高级特征,这些特征由 Open-CLIP 提取,采用空间效率高的方式存储,从而 enables rapid retrieval of the coreset from the Open-Set。为展示所选核心集的有效性,我们将所提方法集成到最先进的细粒度 SSL 框架 SimCore [1] 中。该算法在 SimCore [1] 的采样策略方面性能大幅提升,采样时间降低 ,仅以 的平均准确率牺牲,跨越 个下游数据集进行测试。
引用
@article{arxiv.2412.16942,
title = {BloomCoreset: Fast Coreset Sampling using Bloom Filters for Fine-Grained Self-Supervised Learning},
author = {Prajwal Singh and Gautam Vashishtha and Indra Deep Mastan and Shanmuganathan Raman},
journal= {arXiv preprint arXiv:2412.16942},
year = {2024}
}
备注
Accepted at ICASSP 2025