中文

基于互信息正则化策略梯度的隐私约束策略

机器学习 2024-04-17 v3 密码学与安全

摘要

随着强化学习技术日益应用于现实世界决策问题,人们开始关注这些算法如何使用潜在的敏感信息。我们考虑训练一个在最大化奖励的同时,通过动作最小化某些敏感状态变量泄露的策略的任务。我们给出了该设定如何涵盖顺序决策中隐私相关的现实问题的示例。我们在策略梯度框架中通过引入基于敏感状态与动作之间互信息(MI)的正则化器来解决此问题。我们开发了一种基于模型的随机梯度估计器,用于优化隐私约束策略。我们还讨论了一种替代的 MI 正则化器,它作为我们主要 MI 正则化器的上界并可在无模型设定中优化,以及一种可用于具有可微动态环境的有力直接估计器。我们将先前差分隐私 RL 的工作与我们互信息形式的披露刻画进行了对比。实验结果表明,我们的训练方法产生的策略可隐藏敏感状态,即使在具有挑战性的高维任务中也是如此。

关键词

引用

@article{arxiv.2012.15019,
  title  = {Privacy-Constrained Policies via Mutual Information Regularized Policy Gradients},
  author = {Chris Cundy and Rishi Desai and Stefano Ermon},
  journal= {arXiv preprint arXiv:2012.15019},
  year   = {2024}
}

备注

Accepted to AISTATS 2024