Confidential Guardian:以密码学手段禁止滥用模型弃权
密码学与安全
2025-06-02 v1 人工智能
计算机与社会
机器学习
机器学习
摘要
谨慎预测——即机器学习模型在不确定时选择弃权——对于限制安全关键应用中的有害错误至关重要。在本研究中,我们识别了一种新型威胁:不诚实的机构可利用这些机制,以不确定性为借口进行歧视或不公正地拒绝服务。我们通过引入一种名为 Mirage 的诱导不确定性攻击来演示该威胁的可行性,该攻击故意降低目标输入区域的置信度,从而隐蔽地使特定个体处于不利地位。同时,Mirage 在所有数据点上均保持较高的预测性能。为应对这一威胁,我们提出了 Confidential Guardian 框架,该框架通过分析参考数据集上的校准指标来检测人为压低的置信度。此外,它采用验证推理的零知识证明,以确保报告的置信度分数确实源自所部署的模型。这防止了提供方伪造任意的模型置信度值,同时保护了模型的专有细节。我们的结果证实,Confidential Guardian 能有效防止对谨慎预测的滥用,提供可验证的保证,表明弃权反映了真实的模型不确定性而非恶意意图。
引用
@article{arxiv.2505.23968,
title = {Confidential Guardian: Cryptographically Prohibiting the Abuse of Model Abstention},
author = {Stephan Rabanser and Ali Shahin Shamsabadi and Olive Franzese and Xiao Wang and Adrian Weller and Nicolas Papernot},
journal= {arXiv preprint arXiv:2505.23968},
year = {2025}
}
备注
Proceedings of the 42nd International Conference on Machine Learning