预训练编码器推断:揭示下游机器学习服务中的上游编码器
机器学习
2025-05-27 v2 密码学与安全
摘要
在线获取的预训练编码器已被广泛采用用于构建下游机器学习 (ML) 服务,但针对这些编码器的各种攻击也对此类下游 ML 服务范式构成安全和隐私威胁。我们揭示了一种新漏洞:预训练编码器推断 (PEI) 攻击,该攻击可从目标下游 ML 服务中提取敏感编码器信息,从而用于促进对目标服务的其他 ML 攻击。仅通过对目标下游服务的 API 访问权限以及一组候选编码器,PEI 攻击即可成功推断出目标服务所秘密使用的编码器。与现有编码器攻击(主要针对上游端的编码器)不同,PEI 攻击即使在编码器已部署并隐藏于下游 ML 服务中后仍可 compromise,这使其成为更真实的威胁。我们在视觉编码器上实证验证了 PEI 攻击的有效性。我们首先对两个下游服务(即图像分类和多模态生成)进行 PEI 攻击,然后展示了 PEI 攻击如何促进其他 ML 攻击(即针对图像分类模型的模型窃取攻击和针对多模态生成模型的对抗攻击)。我们的结果呼吁在部署下游服务中的编码器时考虑新的安全和隐私问题。代码已提供:https://github.com/fshp971/encoder-inference
引用
@article{arxiv.2408.02814,
title = {Pre-trained Encoder Inference: Revealing Upstream Encoders In Downstream Machine Learning Services},
author = {Shaopeng Fu and Xuexue Sun and Ke Qing and Tianhang Zheng and Di Wang},
journal= {arXiv preprint arXiv:2408.02814},
year = {2025}
}