中文

通过控制硬件非决定性实现乐观可验证训练

密码学与安全 2024-11-26 v3 人工智能 机器学习

摘要

AI系统日益增长的计算需求导致托管训练服务的兴起,后者为缺乏必要资源的客户提供训练服务。然而,确保训练的正确性并防止潜在的训练时攻击(如数据投毒和后门)具有挑战。现有关于可验证训练的工作大致分为两类:基于证明的系统难以扩展,而“乐观”方法则考虑第三方审计员可以复制训练过程并质疑训练者。后者的一个关键挑战是GPU类型之间的非决定性会阻止对训练过程的精确复制,导致其非稳健。我们提出了一种方法,结合在目标以外的更高精度进行训练、在中间计算后进行四舍五入,并基于自适应阈值程序共享四舍五入决策,以成功控制非决定性。在三个不同的NVIDIA GPU(A40、Titan XP、RTX 2080 Ti)上,我们在FP32精度下实现了对ResNet-50(2300万参数)和GPT-2(1.17亿参数)模型进行完整训练和微调的精确复制。我们的可验证训练方案显著降低了基于证明系统的存储和时间成本,并在https://github.com/meghabyte/verifiable-training 公开发布。

关键词

引用

@article{arxiv.2403.09603,
  title  = {Optimistic Verifiable Training by Controlling Hardware Nondeterminism},
  author = {Megha Srivastava and Simran Arora and Dan Boneh},
  journal= {arXiv preprint arXiv:2403.09603},
  year   = {2024}
}

备注

11 pages, 5 figures, Neural Information Processing Systems (NeurIPS) 2024,