数据投毒下的拜占康鲁亚鲁优化的相关性
机器学习
2024-05-02 v1
摘要
机器学习(ML)的成功与大规模数据的可用性密切相关,这些数据通常来自异构来源并在广泛的计算设备网络上处理(也称为{\em workers})。除了准确率外,ML在医疗保健和自动驾驶等关键领域的应用,要求对{\em 数据投毒}和某些{\em 有故障workers}具有鲁棒性。{\em 拜占康鲁亚鲁学}问题通过考虑工作者(存储全局数据集的子集)可任意偏离指定算法的分布式ML环境来形式化这些鲁棒性问题。尽管该问题在理论层面吸引了大量注意力,但其针对现实故障(即任何工作者的行为在本地受到约束)的实际重要性尚不明确。人们认为,仅使工作者的本地数据遭受投毒的看似较弱威胁模型更为合理。我们证明了,尽管容忍更广泛的故障行为,拜占康鲁亚鲁学仍能在较弱的数据投毒威胁模型下提供最优解。随后,我们研究了一种通用的数据投毒模型,其中一些工作者拥有{\em 完全投毒本地数据},即其数据集完全可被篡改,其余工作者拥有{\em 部分投毒本地数据},即仅其数据集的部分内容可被篡改。我们证明了拜占康鲁亚鲁方案能够针对这两种数据投毒形式提供最优解,并且前者在工作者拥有异构本地数据时更为有害。
关键词
引用
@article{arxiv.2405.00491,
title = {On the Relevance of Byzantine Robust Optimization Against Data Poisoning},
author = {Sadegh Farhadkhani and Rachid Guerraoui and Nirupam Gupta and Rafael Pinot},
journal= {arXiv preprint arXiv:2405.00491},
year = {2024}
}
备注
38 pages