中文

马尔可夫决策过程中的隐私保护策略合成

系统与控制 2020-04-17 v1 密码学与安全 系统与控制

摘要

在决策问题中,智能体的动作可能泄露驱动其决策的敏感信息。例如,公司的投资决策可能暴露其对市场动态的敏感认知。为防止此类信息泄露,我们提出一种策略合成算法,用于保护马尔可夫决策过程中转移概率的隐私。我们以差分隐私作为隐私的数学定义。该算法首先使用提供差分隐私的机制对转移概率进行扰动,然后基于私有化后的转移概率,利用动态规划合成策略。我们的主要贡献在于界定“隐私代价”,即含隐私与不含隐私情形下的期望总回报之差。我们还证明计算隐私代价的时间复杂度关于问题参数呈多项式级。此外,我们确立隐私代价随差分隐私保护强度增加而上升,并量化了这一增长。最后,在两个示例环境中的数值实验验证了所建立的隐私代价与数据隐私保护强度之间的关系。

关键词

引用

@article{arxiv.2004.07778,
  title  = {Privacy-Preserving Policy Synthesis in Markov Decision Processes},
  author = {Parham Gohari and Matthew Hale and Ufuk Topcu},
  journal= {arXiv preprint arXiv:2004.07778},
  year   = {2020}
}

备注

Submitted to the Conference on Decision and Control (CDC) 2020