基于集成主动学习的训练数据子集搜索
机器学习
2020-11-10 v3 机器学习
摘要
深度神经网络(DNNs)通常依赖非常大的数据集进行训练。鉴于此类数据集规模巨大,可以想见其中含有某些既无贡献又对 DNN 优化产生负面影响的样本。以排除此类样本的方式修改训练分布,可提供一种有效方案,既能提升性能又能缩短训练时间。在本文中,我们提出扩展集成主动学习(AL)方法以大规模(一次 10k 至 500k 样本)执行采集。我们通过复用中间训练检查点以极小计算成本获得数百个模型的集成来实现这一点。这使我们能够自动且高效地对大型标注数据集执行训练数据子集搜索。我们观察到我们的方法获得了有利的训练数据子集,可用于训练比使用整个数据集训练更准确的 DNNs。我们在三个图像分类基准(CIFAR-10、CIFAR-100 和 ImageNet)以及一个用于自动驾驶感知模型原型设计的内部目标检测基准上对该现象进行了广泛的实验研究。与现有研究不同,我们在目标检测上的实验达到了生产级自动驾驶系统所需的规模。我们提供了关于不同初始化方案、采集函数和该规模下集成配置影响的见解。我们的结果提供了强有力的经验证据,表明优化训练数据分布可在大规模视觉任务上带来显著收益。
引用
@article{arxiv.1905.12737,
title = {Training Data Subset Search with Ensemble Active Learning},
author = {Kashyap Chitta and Jose M. Alvarez and Elmar Haussmann and Clement Farabet},
journal= {arXiv preprint arXiv:1905.12737},
year = {2020}
}