中文

现实数据池假设下的对比学习深度主动学习

计算机视觉与模式识别 2023-03-28 v1 机器学习

摘要

主动学习旨在从未标注数据池中识别最具信息量的数据,使模型能够快速达到期望精度。这对于通常需要大量标注样本才能实现高性能的深度神经网络尤为有益。大多数现有主动学习方法在理想设定下评估,即未标注数据池中仅存在与目标任务相关的样本(即分布内样本)。然而,从真实环境中收集的数据池很可能包含完全与目标任务无关的样本,和/或即便对于标注者而言也过于模糊而无法赋予单一类别标签的样本。我们认为,假设未标注数据池由来自多种分布的样本组成更为现实。本工作中,我们引入了新的主动学习基准,其中包含模糊的、任务无关的分布外样本以及分布内样本。我们还提出了一种主动学习方法,旨在优先获取有信息的分布内样本。所提方法同时利用已标注与未标注数据池,并从通过对比学习构建的特征空间聚类中选择样本。实验结果表明,相较于现有主动学习方法,所提方法达到同等精度所需标注预算更低。

关键词

引用

@article{arxiv.2303.14433,
  title  = {Deep Active Learning with Contrastive Learning Under Realistic Data Pool Assumptions},
  author = {Jihyo Kim and Jeonghyeon Kim and Sangheum Hwang},
  journal= {arXiv preprint arXiv:2303.14433},
  year   = {2023}
}

备注

AAAI 2023 Workshop on Practical Deep Learning in the Wild