面向差分隐私语言模型对齐的改进算法
密码学与安全
2025-05-15 v1 人工智能
机器学习
摘要
语言模型对齐对于确保大型语言模型(LLM)与人类偏好一致至关重要,但通常涉及敏感用户数据,引发显著隐私 concerns。虽然先前工作将差分隐私(DP)与对齐技术集成,但其性能有限。本文提出了面向隐私保护对齐的新型算法,并严格分析其在不同隐私预算和模型下的有效性。我们的框架可部署在两种著名对齐技术上,即直接偏好优化(DPO)和强化学习从人类反馈(RLHF)。通过大规模语言模型上的系统实验,我们展示了我们的方法实现了最先进的性能。值得注意的是,我们的一个算法DP-AdamW结合DPO后,超过现有方法,在适中隐私预算({\epsilon}=2-5)下提升了对齐质量最高可达15%。我们进一步探讨了隐私保证、对齐效能和计算需求之间的相互作用,为优化这些权衡提供了实用指南。
引用
@article{arxiv.2505.08849,
title = {Improved Algorithms for Differentially Private Language Model Alignment},
author = {Keyu Chen and Hao Tang and Qinglin Liu and Yizhao Xu},
journal= {arXiv preprint arXiv:2505.08849},
year = {2025}
}