KNN 数据投毒鲁棒性的系统性测试
软件工程
2023-07-18 v1 机器学习
摘要
数据投毒旨在通过污染机器学习软件组件的训练集以改变其对测试输入的预测结果,从而破坏该组件。现有的数据投毒鲁棒性判定方法要么精度差要么耗时长,更重要的是,它们只能证明部分真正鲁棒的情况,而在证明失败时仍无法得出结论。换言之,它们无法证伪真正非鲁棒的情况。为克服此局限,我们提出一种基于系统性测试的方法,可对一种广泛使用的监督学习技术——k-近邻(KNN)的数据投毒鲁棒性进行证伪与证明。由于抽象域中新颖的过近似分析可快速缩小搜索空间,以及具体域中的系统性测试可发现实际违例,我们的方法比基线枚举方法更快且更准。我们已在多个监督学习数据集上评估了该方法。结果表明,该方法显著优于现有技术,并能对大多数测试输入的 KNN 预测结果判定数据投毒鲁棒性。
引用
@article{arxiv.2307.08288,
title = {Systematic Testing of the Data-Poisoning Robustness of KNN},
author = {Yannan Li and Jingbo Wang and Chao Wang},
journal= {arXiv preprint arXiv:2307.08288},
year = {2023}
}