面向 DNN 模型所有权验证的 Proof-of-Training 安全性研究
密码学与安全
2024-10-11 v2 人工智能
摘要
深度神经网络 (DNN) 具有巨大的经济价值,促使 AI 企业为这些模型保护其知识产权 (IP)。最近,proof-of-training (PoT) 作为一种保护 DNN IP 的潜在解决方案被提出,通过利用 DNN 训练过程的记录作为所有权证明。为了防止攻击者伪造所有权证明,安全的 PoT 方案应能够区分诚实的训练记录与攻击者伪造的记录。尽管现有的 PoT 方案提供了各种区分标准,但这些标准基于直觉或观察,缺乏明确且全面的分析,导致一些最初被认为是安全的方案很快就被简单想法所破解。本文首次以形式化方法的风格识别区分标准,以便明确展示其有效性。具体而言,我们进行系统建模以覆盖广泛的攻击类型,然后对诚实记录与伪造记录之间的区别进行理论分析。分析结果不仅诱导出一种通用区分标准,还提供详细的推理以说明其在防御我们模型所覆盖的攻击方面的有效性。基于该标准,我们提出了一个通用的 PoT 构造方案,可实例化为具体方案。该构造揭示了之前在数据提炼中使用的轨迹匹配算法在 PoT 构造中具有显著优势。实验结果表明,我们的方案能够抵抗那些已经破解了现有 PoT 方案的攻击,证明了其在安全性方面的优越性。
引用
@article{arxiv.2410.04397,
title = {Towards Understanding and Enhancing Security of Proof-of-Training for DNN Model Ownership Verification},
author = {Yijia Chang and Hanrui Jiang and Chao Lin and Xinyi Huang and Jian Weng},
journal= {arXiv preprint arXiv:2410.04397},
year = {2024}
}
备注
Accepted by USENIX Security 2025 (Major Revision -> Accept)