中文

LADA:通过增强进行前瞻数据采集的主动学习方法

机器学习 2020-11-18 v3 人工智能

摘要

当标注数据集有限且标注成本高时,主动学习能有效地收集数据实例以训练深度学习模型。除主动学习外,数据增强也是扩大有限标注实例数量的有效技术。然而,主动学习采集过程中尚未考虑由数据增强生成的虚拟实例的潜在收益。在采集过程中前瞻数据增强的效果,将选择并生成对训练模型具有信息量的数据实例。因此,本文提出通过增强进行前瞻数据采集(Look-Ahead Data Acquisition via augmentation,简称LADA),以整合数据采集与数据增强。LADA在采集过程之前同时考虑1)待选择的未标注数据实例与2)由数据增强待生成的虚拟数据实例。此外,为增强虚拟数据实例的信息量,LADA优化数据增强策略以最大化预测采集分数,从而提出InfoMixup与InfoSTN。由于LADA是可泛化的框架,我们使用采集与增强方法的不同组合进行了实验。LADA的性能相比近期独立应用于基准数据集的增强与采集基线有显著提升。

关键词

引用

@article{arxiv.2011.04194,
  title  = {LADA: Look-Ahead Data Acquisition via Augmentation for Active Learning},
  author = {Yoon-Yeong Kim and Kyungwoo Song and JoonHo Jang and Il-Chul Moon},
  journal= {arXiv preprint arXiv:2011.04194},
  year   = {2020}
}