中文

PROPS:大型语言模型的渐进式隐私自对齐框架

机器学习 2025-12-11 v2 人工智能 密码学与安全 信息论 math.IT

摘要

对齐是开发大型语言模型 (LLM) 的关键步骤,需通过人类反馈确保遵循人类价值观与社会规范。对人类反馈的依赖引发隐私顾虑——标签员的偏好可能透露其个人价值观、信念及性格特征。现有方法如差分隐私随机梯度下降 (DP-SGD) 通过对微调过程中的梯度进行隐私化处理以提供严格的隐私保障,但因人类偏好仅与 (提示词、响应) 对的标签相关,可能施加过多隐私约束并损害模型实用性。本文聚焦偏好级隐私,即保留人类提供的偏好标签的隐私。我们提出 PROPS (PROgressively Private Self-alignment),一个多阶段隐私保护对齐框架,其中前一阶段隐私对齐后的模型可作为后续阶段对齐训练数据标签的补充者。我们给出 PROPS 的理论保证,并通过多一模型 (Pythia 与 GPT) 与数据集 (AlpacaEval、Anthropic HH-RLHF、truthy-dpo-v0.1) 进行全面验证,展示 PROPS 在保持高隐私保障的同时相较于现有方法具有更佳实用性。就相同隐私预算而言,PROPS 实现的胜率可较 DP-SGD 提升最高达 3 倍,较基于随机响应 (RR) 的对齐提升最高达 2.5 倍。

关键词

引用

@article{arxiv.2508.06783,
  title  = {PROPS: Progressively Private Self-alignment of Large Language Models},
  author = {Noel Teku and Fengwei Tian and Payel Bhattacharjee and Souradip Chakraborty and Amrit Singh Bedi and Ravi Tandon},
  journal= {arXiv preprint arXiv:2508.06783},
  year   = {2025}
}

备注

Accepted in the Transactions on Machine Learning Research (TMLR), 2025