中文

增强在线学习模型在高度噪声数据上的鲁棒性

机器学习 2021-03-22 v1

摘要

分类算法已被广泛用于各类系统(如物联网、云和人脸识别)的异常检测,其常见假设是数据源干净,即特征与标签均正确设定。然而,从实际环境中收集的数据可能因标注疏忽或恶意数据变换而导致错误异常检测,从而不可靠。本文扩展了一个双层在线数据选择框架:鲁棒异常检测器(RAD),其新设计的集成预测使两层均参与最终异常检测决策。为适应异常检测的在线特性,我们考虑了分类器冲突意见、重复清洗和预言知识的附加特征。我们从 incoming 数据流中在线学习并持续清洗数据,从而适应来自更大数据集的日益增长的学习能力。此外,我们探索了预言学习的概念,为困难数据点提供真实标签的附加信息。我们具体关注三个用例:(i)检测10类物联网攻击,(ii)预测大数据作业的4类任务失败,(iii)识别100位名人面孔。评估结果表明,RAD能鲁棒地提升异常检测准确率,在40%标签噪声下对物联网设备攻击可达98.95%(即+7%),对云任务失败可达85.03%(即+14%);其扩展在30%标签噪声下对人脸识别可达77.51%(即+39%)。所提RAD及其扩展具有通用性,可应用于不同异常检测算法。

关键词

引用

@article{arxiv.2103.10824,
  title  = {Enhancing Robustness of On-line Learning Models on Highly Noisy Data},
  author = {Zilong Zhao and Robert Birke and Rui Han and Bogdan Robu and Sara Bouchenak and Sonia Ben Mokhtar and Lydia Y. Chen},
  journal= {arXiv preprint arXiv:2103.10824},
  year   = {2021}
}

备注

Published in IEEE Transactions on Dependable and Secure Computing. arXiv admin note: substantial text overlap with arXiv:1911.04383