数据集筛选:面向基于蒸馏的领域专用模型的高效训练
计算机视觉与模式识别
2019-05-17 v3
摘要
用于监控等应用的实时基于CNN的目标检测模型可以达到高精度,但计算开销大。近期工作表明,通过使用领域专用网络,推理的计算成本可降低10至100倍。然而,先前工作仅关注推理。若领域模型需要频繁重训练,训练成本会成为显著瓶颈。为此,我们提出数据集筛选(Dataset Culling):一种基于预测难度来缩减训练数据集规模的流水线。易于分类的图像被过滤掉,因为它们对提升精度贡献甚微。该难度使用我们提出的置信度损失(confidence loss)度量来衡量,计算开销很小。数据集筛选被进一步扩展以优化图像分辨率,从而进一步改善训练与推理成本。我们构建了多个领域下固定视角、长时长的视频数据集,并表明数据集规模可被筛选缩减300倍,将总训练时间减少47倍,且无精度损失甚至略有提升。代码已公开:https://github.com/kentaroy47/DatasetCulling
引用
@article{arxiv.1902.00173,
title = {Dataset Culling: Towards Efficient Training Of Distillation-Based Domain Specific Models},
author = {Kentaro Yoshioka and Edward Lee and Simon Wong and Mark Horowitz},
journal= {arXiv preprint arXiv:1902.00173},
year = {2019}
}
备注
accepted to IEEE ICIP 2019. 5 pages