中文

基于图半监督分类器中的影响驱动数据投毒

机器学习 2022-05-12 v2 软件工程

摘要

基于图的半监督学习(GSSL)是一种从有限标记数据与大量未标记数据中学习的实用方案。然而,由于这类算法依赖已知标签推断未知标签,它们对数据质量敏感。因此,研究与被标记数据相关的潜在威胁,更具体地,标签投毒,至关重要。在本文中,我们提出一种新颖的数据投毒方法,其高效近似标签推断的结果,以识别若被投毒将产生最多错误推断标签的输入。我们在三个分类问题上各以24种不同实验设置广泛评估了我们的方法。与最先进技术相比,我们的影响驱动攻击产生的错误率平均高出50%,同时速度快多个数量级。此外,我们的方法可告知工程师在训练学习模型前值得调查(重新标记)的输入。我们表明,重新标记三分之一的投毒输入(基于其影响选择)可将投毒效应降低50%。

关键词

引用

@article{arxiv.2012.07381,
  title  = {Influence-Driven Data Poisoning in Graph-Based Semi-Supervised Classifiers},
  author = {Adriano Franci and Maxime Cordy and Martin Gubri and Mike Papadakis and Yves Le Traon},
  journal= {arXiv preprint arXiv:2012.07381},
  year   = {2022}
}