中文

用于对齐大语言模型的隐私保护指令

密码学与安全 2024-07-03 v2 计算与语言

摘要

大语言模型(LLM)应用的服务提供商在自然环境中收集用户指令,并将其用于进一步使LLM与用户意图对齐。这些指令可能包含敏感信息,在处理过程中由人工工作者进行标注。这带来了典型的隐私优化方法无法解决的新隐私风险。为此,我们提出在数据标注和模型微调中使用合成指令来替代真实指令。通过使用私有微调的生成器生成这些合成指令,保证了形式化的差分隐私。实现预期效用的关键在于我们提出的一种新颖的过滤算法,该算法将合成指令的分布与真实指令的分布相匹配。在监督微调和基于人类反馈的强化学习中,我们的大量实验表明,最终合成指令集具有很高的效用,其结果与真实指令相当。在监督微调中,使用私有合成指令训练的模型优于Vicuna等领先的开源模型。

关键词

引用

@article{arxiv.2402.13659,
  title  = {Privacy-Preserving Instructions for Aligning Large Language Models},
  author = {Da Yu and Peter Kairouz and Sewoong Oh and Zheng Xu},
  journal= {arXiv preprint arXiv:2402.13659},
  year   = {2024}
}

备注

ICML 2024. Code available at https://github.com/google-research/google-research/tree/master/dp_instructions