中文

联合分布外过滤与数据发现主动学习

计算机视觉与模式识别 2025-03-05 v1 机器学习

摘要

随着深度学习模型对数据需求的增加,主动学习(AL)变得至关重要,它能有策略地选择样本进行标注,从而最大化数据效率并降低训练成本。现实场景要求在 AL 中考虑不完整的数据知识。先前的工作致力于处理分布外(OOD)数据,而另一个研究方向则聚焦于类别发现。然而,将 AL 与分布外数据和类别发现相结合的现实考量联合分析仍未被探索。为填补这一空白,我们提出联合分布外过滤与数据发现主动学习(Joda),通过在选择候选标注样本前过滤掉 OOD 数据,独特地同时应对这两项挑战。与以往方法不同,我们将训练过程与过滤和选择深度交织,以构建一个公共特征空间,该空间在对齐已知类别与新类别的同时分离 OOD 样本。不同于先前的工作,Joda 具有高效性,完全省去了辅助模型,且在过滤或选择时无需访问未标记池进行训练。在涵盖 18 种配置和 3 项指标的广泛实验中,与最先进的竞争方法相比,\ours{} 始终获得最高准确率,并在类别发现与 OOD 过滤之间取得最佳平衡。

关键词

引用

@article{arxiv.2503.02491,
  title  = {Joint Out-of-Distribution Filtering and Data Discovery Active Learning},
  author = {Sebastian Schmidt and Leonard Schenk and Leo Schwinn and Stephan Günnemann},
  journal= {arXiv preprint arXiv:2503.02491},
  year   = {2025}
}