中文

KL正则化本身在多臂赌博机和RLHF中具有差分隐私性

机器学习 2025-10-17 v2 人工智能

摘要

差分隐私(DP)提供了一种严格的隐私框架,确保数据驱动算法的输出在仅有一个条目不同的数据集之间保持统计上不可区分。虽然保证DP通常需要显式地向算法本身或其输出注入噪声,但现有算法的内在随机性为免费实现DP提供了机会。在本工作中,我们探讨了正则化在实现DP中的作用,涉及三个不同的决策问题:多臂赌博机、线性情境赌博机以及来自人类反馈的强化学习(RLHF),在离线数据设置下。我们表明,将KL正则化添加到学习目标中(这是优化算法中常见的方法)会使从 resulting stochastic policy 中采样的动作本身具有差分隐私。这为在不额外注入噪声的情况下提供隐私保证的新方法,同时也保留了正则化在提升性能方面的固有优势。

关键词

引用

@article{arxiv.2505.18407,
  title  = {KL-regularization Itself is Differentially Private in Bandits and RLHF},
  author = {Yizhou Zhang and Kishan Panaganti and Laixi Shi and Juba Ziani and Adam Wierman},
  journal= {arXiv preprint arXiv:2505.18407},
  year   = {2025}
}