中文

数据集筛选:面向基于蒸馏的领域专用模型的高效训练

计算机视觉与模式识别 2019-05-17 v3

摘要

用于监控等应用的实时基于CNN的目标检测模型可以达到高精度,但计算开销大。近期工作表明,通过使用领域专用网络,推理的计算成本可降低10至100倍。然而,先前工作仅关注推理。若领域模型需要频繁重训练,训练成本会成为显著瓶颈。为此,我们提出数据集筛选(Dataset Culling):一种基于预测难度来缩减训练数据集规模的流水线。易于分类的图像被过滤掉,因为它们对提升精度贡献甚微。该难度使用我们提出的置信度损失(confidence loss)度量来衡量,计算开销很小。数据集筛选被进一步扩展以优化图像分辨率,从而进一步改善训练与推理成本。我们构建了多个领域下固定视角、长时长的视频数据集,并表明数据集规模可被筛选缩减300倍,将总训练时间减少47倍,且无精度损失甚至略有提升。代码已公开:https://github.com/kentaroy47/DatasetCulling

关键词

引用

@article{arxiv.1902.00173,
  title  = {Dataset Culling: Towards Efficient Training Of Distillation-Based Domain Specific Models},
  author = {Kentaro Yoshioka and Edward Lee and Simon Wong and Mark Horowitz},
  journal= {arXiv preprint arXiv:1902.00173},
  year   = {2019}
}

备注

accepted to IEEE ICIP 2019. 5 pages