对比隐私:一种衡量基于 AI 的数据消除隐私的语义方法
密码学与安全
2026-05-06 v1
摘要
为了消除图像和文本中的特定概念,往往不使用具有形式保证的隐私机制,而是倾向于更直观的技术方法。基于 AI 的数据消除因其能够处理自然语言概念的语义而正逐流行;例如,提示可为“删除面部、服装和身体轮廓”。尽管已有大量商业方法和已有工作,但这些方法的评估缺乏形式化保证。为填补这一空白,我们提出对比隐私(contrastive privacy),这是一种提供语义解释的隐私形式化定义,可对消除后的媒体进行系统且定量的测试。该定义独立于所使用的模型和机制,跨越多种媒介。对比隐私在理想条件下提供保证;我们展示如何通过由 CLIP 等模型提供的不完美语义度量进行操作化,该模型可在潜在空间中连接概念。值得注意的是,算法通过与同一语料库中其他图像进行对比来做出判断;无需人工标注。在实验中,我们将隐私测试应用于图像和文本,使用前沿模型:部分模型生成要消除的概念,其他模型执行消除。我们对 34 种模型在图像上的消除成功情况进行量化,对 15 个模型在文本上的消除进行测试。该方法不仅量化整体成功情况,还从消除后的语料库中识别特定的失效情况。进一步地,无论消除机制为暗化像素、模糊处理,还是采用更高级的隐蔽方式,该方法均适用。
关键词
引用
@article{arxiv.2605.02977,
title = {Contrastive Privacy: A Semantic Approach to Measuring Privacy of AI-based Sanitization},
author = {George Bissias and Eugene Bagdasarian and Brian Neil Levine},
journal= {arXiv preprint arXiv:2605.02977},
year = {2026}
}