通过对实时流量训练提升分类器的鲁棒性
机器学习
2018-12-04 v1 机器学习
摘要
深度学习模型已知对分布外输入会给出过度自信的预测。当模型在特定输入数据集上训练,而在实际部署时接收到样本外数据时,这是一个挑战。近来已有研究通过添加正则化项以最大化分类器在分布外数据上输出的熵,来构建对分布外样本鲁棒的分类器。然而,鉴于并非总能获得分布外样本,作者提出了一种基于 GAN 的替代方案,其不依赖于对分布外样本的特定知识。从已有工作中我们也知道,使用真实的样本外分布进行正则化远比使用 GAN 生成的样本效果好。在本文中,我们提出以下观察:在实践中,分布外样本包含于命中已部署分类器的流量中。但流量同时也会包含未知比例的分布内样本。若朴素地最大化所有流量数据的熵,将损害分类器在分布内数据上的性能。为有效利用该流量数据,我们提出一种自适应正则化技术(基于样本的最大预测概率得分),其对传入流量中分布外样本的惩罚重于分布内样本。这确保了分类器在分布内数据上的整体性能不退化,同时借助无标签流量数据显著改进了分布外样本的检测。我们通过自然图像数据集上的实验展示了方法的有效性。
引用
@article{arxiv.1812.00237,
title = {Improving robustness of classifiers by training against live traffic},
author = {Kumar Sricharan and Kumar Kallurupalli and Ashok Srivastava},
journal= {arXiv preprint arXiv:1812.00237},
year = {2018}
}
备注
Third workshop on Bayesian Deep Learning (NeurIPS 2018), Montr\'eal, Canada