面向大型语言模型对齐的差分隐私驾驶
计算与语言
2025-03-21 v2 机器学习
摘要
与人类价值观及无望行为(如幻觉)对齐的大型语言模型(LLM)越来越受重视。最近,一种通过激活编辑引导 LLM 向所需行为发挥作用的方法已被证明可有效缓解有害生成。激活编辑通过保留来自正面演示(如诚实)的信息,并最小化来自负面演示(如幻觉)的信息来修改 LLM 表示。当这些演示来自私有数据集时,对齐后的 LLM 可能泄露这些私有样本中包含的私有信息。本文提出了首个针对使用私有数据集进行 LLM 对齐的研究。我们提出了面向 LLM 对齐的私有驾驶(PSA)算法,通过差分隐私(DP)保证编辑 LLM 激活。我们在七个不同基准上进行了实验,测试规模从 0.5B 到 7B 的开源 LLM(包括 Llama、Qwen、Mistral 和 Gemma)。我们的结果表明,PSA 在保持性能的同时为 LLM 对齐提供了 DP 保证,包括对齐指标、开放式文本生成质量和通用推理能力。我们还开发了首个用于评估和审计 LLM 通过激活编辑实现驾驶问题中经验隐私的成员推断攻击(MIA)。我们的实验支持理论保证,显示我们的 PSA 算法在多个现有非私有技术之上具有更好的保证。
引用
@article{arxiv.2501.18532,
title = {Differentially Private Steering for Large Language Model Alignment},
author = {Anmol Goel and Yaxi Hu and Iryna Gurevych and Amartya Sanyal},
journal= {arXiv preprint arXiv:2501.18532},
year = {2025}
}
备注
ICLR 2025 Camera Ready; Code: https://github.com/UKPLab/iclr2025-psa