暴露隐私漏洞:针对大语言模型对齐偏好数据的成员推理攻击
人工智能
2025-04-29 v2
摘要
大型语言模型(LLM)因其卓越的自然语言能力而得到广泛应用。然而,在现实场景中部署时,必须使LLM按照可接受的人类标准生成文本。近端策略优化(PPO)和直接偏好优化(DPO)等方法在使用人类偏好数据优化LLM方面取得了显著进展。然而,使用此类偏好数据所固有的隐私问题尚未得到充分研究。本文研究了使用两种广泛使用的方法——DPO和PPO——对齐的LLM对成员推理攻击(MIA)的脆弱性。我们的研究有两个主要贡献:首先,我们从理论上论证了DPO模型比PPO模型更容易受到MIA攻击;其次,我们引入了一种新颖的、专门用于分析偏好数据的基于参考的攻击框架,称为PREMIA(偏好数据MIA)。使用PREMIA和现有基线,我们通过实验证明DPO模型对MIA具有相对更高的脆弱性。
引用
@article{arxiv.2407.06443,
title = {Exposing Privacy Gaps: Membership Inference Attack on Preference Data for LLM Alignment},
author = {Qizhang Feng and Siva Rajesh Kasa and Santhosh Kumar Kasa and Hyokun Yun and Choon Hui Teo and Sravan Babu Bodapati},
journal= {arXiv preprint arXiv:2407.06443},
year = {2025}
}