中文

UTrace:面向私密协作学习的投毒取证

密码学与安全 2025-10-02 v3 机器学习

摘要

隐私保护机器学习 (PPML) 系统通过利用加密协议如安全多方计算 (MPC) 使多个数据所有者能够在不透露原始敏感数据的情况下协同训练模型。虽然 PPML 提供了强大的隐私保证,但也引入了新的攻击面:恶意数据所有者可以在训练过程中注入受感染数据而不被检测,从而破坏所学习模型的完整性。虽然最近的防御措施,如 MPC 中的私有输入验证,可以缓解某些特定的投毒策略,但仍不足,特别是防止狡猾或分布式攻击。鉴于 PPML 的鲁棒性仍是一个开放挑战,加强对这些系统信任的力量越来越需要后续审计机制以施加问责。在本文中,我们提出了 UTrace,一个用于 PPML 的用户级 traceback 框架,可在不破坏 MPC 隐私保证的情况下将完整性失败归因于负责的数据所有者。UTrace 包含两种机制:一种识别与投毒相关的可疑更新模式的梯度相似性方法,以及一种量化每个用户对模型行为影响的user-level unlearning 技术。通过这两种方法,UTrace 能够以高精度将模型异常行为归因于特定用户。我们在 MPC 兼容的训练和审计管道中实现 UTrace,并在覆盖视觉、文本和恶意软件的四个数据集上对其有效性进行了评估。在十种标准投毒攻击中,UTrace 始终以高检测准确率和低误报率实现一致的有效性。

关键词

引用

@article{arxiv.2409.15126,
  title  = {UTrace: Poisoning Forensics for Private Collaborative Learning},
  author = {Evan Rose and Hidde Lycklama and Harsh Chaudhari and Niklas Britz and Anwar Hithnawi and Alina Oprea},
  journal= {arXiv preprint arXiv:2409.15126},
  year   = {2025}
}

备注

31 pages, 10 figures