中文

紧跟动态攻击者:认证自适应在线数据投毒的鲁棒性

机器学习 2025-02-25 v1

摘要

在潜在不可信用户的人类反馈上微调基础模型的兴起增加了对抗性数据投毒的风险,使得研究学习算法对此类攻击的鲁棒性变得必要。现有关于针对数据投毒攻击的可证明认证鲁棒性的研究主要聚焦于认证对静态对抗者的鲁棒性,后者在训练算法应用前修改用于训练模型的数据集的一部分。在实践中,特别是在在线地从人类反馈学习时,对抗者可以观察并响应学习过程,并注入优化对抗目标的投毒样本,其效果优于他们被限制在训练算法应用前一次性投毒静态数据集时。事实上,先前的研究已表明在线动态对抗者可能比静态对抗者强大得多。我们提出了一种计算动态投毒影响认证边界的新框架,并使用这些证书设计鲁棒学习算法。我们为均值估计和二分类问题展示了该框架的一个实例,并概述了在后续工作中扩展的方向。实现我们证书和复现我们结果的代码可在 https://github.com/Avinandan22/Certified-Robustness 获取。

关键词

引用

@article{arxiv.2502.16737,
  title  = {Keeping up with dynamic attackers: Certifying robustness to adaptive online data poisoning},
  author = {Avinandan Bose and Laurent Lessard and Maryam Fazel and Krishnamurthy Dj Dvijotham},
  journal= {arXiv preprint arXiv:2502.16737},
  year   = {2025}
}

备注

Proceedings of the 28th International Conference on Artificial Intelligence and Statistics (AISTATS) 2025, Mai Khao, Thailand. PMLR: Volume 258