中文

通过复制外部训练来检测后门

密码学与安全 2025-04-02 v1 人工智能 机器学习 机器学习

摘要

将机器学习模型训练 outsourcing 到云端供应商是常见做法。委托云端后,客户从中获得规模经济收益,但隐式假设服务商应遵守客户的训练程序。恶意服务商可能,例如试图在模型中植入后门。在没有对后门攻击及其伴随触发器先验知识的情况下检测后门模型 remains 一个具有挑战性的问题。在本文中,我们表明拥有多个云端供应商的客户可以通过复制一部分训练步骤在多个服务器之间进行检测,以类似差分测试的方式识别训练程序的偏差。假设一些云端提供的服务器是良性的,我们通过大幅度的模型更新差异来识别植入后门的服务器,而这些差异是干净训练所产生的更新与之不同。我们方法最有力的优势之一是其适用于计算能力有限或毫无本地计算能力的客户;我们利用多个云端供应商的存在来识别恶意更新,而无需昂贵的人工标注或重型计算。我们在外部监督学习任务上展示了该方法的能力,其中 50% 的云端供应商植入自己的后门;我们的 method 能够正确识别 99.6% 的后门。简言之,我们的方法之所以成功,是因为它取代了现有方法所采用的基于签名的范式,转而采用基于异常的检测范式。此外,我们的方法对来自利用我们检测方案知识的自适应攻击具有鲁棒性。

关键词

引用

@article{arxiv.2504.00170,
  title  = {Backdoor Detection through Replicated Execution of Outsourced Training},
  author = {Hengrui Jia and Sierra Wyllie and Akram Bin Sediq and Ahmed Ibrahim and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2504.00170},
  year   = {2025}
}

备注

Published in the 3rd IEEE Conference on Secure and Trustworthy Machine Learning (IEEE SaTML 2025)