中文

暴露隐私漏洞:针对大语言模型对齐偏好数据的成员推理攻击

人工智能 2025-04-29 v2

摘要

大型语言模型(LLM)因其卓越的自然语言能力而得到广泛应用。然而,在现实场景中部署时,必须使LLM按照可接受的人类标准生成文本。近端策略优化(PPO)和直接偏好优化(DPO)等方法在使用人类偏好数据优化LLM方面取得了显著进展。然而,使用此类偏好数据所固有的隐私问题尚未得到充分研究。本文研究了使用两种广泛使用的方法——DPO和PPO——对齐的LLM对成员推理攻击(MIA)的脆弱性。我们的研究有两个主要贡献:首先,我们从理论上论证了DPO模型比PPO模型更容易受到MIA攻击;其次,我们引入了一种新颖的、专门用于分析偏好数据的基于参考的攻击框架,称为PREMIA(偏好数据MIA)。使用PREMIA和现有基线,我们通过实验证明DPO模型对MIA具有相对更高的脆弱性。

关键词

引用

@article{arxiv.2407.06443,
  title  = {Exposing Privacy Gaps: Membership Inference Attack on Preference Data for LLM Alignment},
  author = {Qizhang Feng and Siva Rajesh Kasa and Santhosh Kumar Kasa and Hyokun Yun and Choon Hui Teo and Sravan Babu Bodapati},
  journal= {arXiv preprint arXiv:2407.06443},
  year   = {2025}
}