中文

面向高效批量主动学习的数据 Shapley 估值

机器学习 2021-04-20 v1 机器学习

摘要

在所有可用数据点中标注正确的数据集合,是许多机器学习应用中的关键挑战。批量主动学习是一种流行的应对方法,其中选取批量未标注数据点进行标注,随后底层学习算法被更新。在数据可并行标注且模型训练计算昂贵的场景下,递增更大的批量尤其具有吸引力。这里的一个关键挑战是规模——典型的主动学习方法依赖多样性技术,从未标注池中选取多样化数据点进行标注。本工作中,我们引入主动数据 Shapley(Active Data Shapley, ADS)——一种用于批量主动学习的过滤层,它通过线性时间计算预选出来自未标注数据集的最高价值点,显著提升主动学习的效率。利用数据的 Shapley 值概念,我们的方法针对当前预测任务估计未标注数据点的价值。我们表明,当未标注数据池呈现真实世界的缺陷(噪声、异质性和域偏移)时,ADS 尤为有效。我们开展的实验证明,当使用 ADS 预选未标注数据集中排名最高的部分时,最先进批量主动学习方法的效率平均提升 6 倍,同时保持性能有效性。

关键词

引用

@article{arxiv.2104.08312,
  title  = {Data Shapley Valuation for Efficient Batch Active Learning},
  author = {Amirata Ghorbani and James Zou and Andre Esteva},
  journal= {arXiv preprint arXiv:2104.08312},
  year   = {2021}
}