中文

马尔可夫决策过程策略综合中的差分隐私奖励函数

系统与控制 2024-09-04 v3 系统与控制

摘要

马尔可夫决策过程通常寻求最大化奖励函数,但旁观者可通过观测此类系统的状态与动作推断奖励函数,泄露敏感信息。因此,本文引入并比较两种在多智能体马尔可夫决策过程(马尔可夫决策过程的推广)策略综合中隐私化奖励函数的方法。奖励函数使用差分隐私(一种保护敏感数据的统计框架)进行隐私化。我们开发的方法扰动(1)每个智能体的个体奖励函数或(2)所有智能体共享的联合奖励函数。我们证明方法(1)提供更好性能。随后我们开发多项式时间算法,逐例数值计算由隐私导致的性能损失。接着,使用方法(1),我们制定选择奖励函数值的准则,以在保持隐私的同时保留“目标”与“规避”状态,并量化由隐私化奖励计算策略所需增加的计算复杂度。在三类药物系统上进行的数值仿真揭示出与隐私令人惊讶的兼容性:在平均意义上使用合理强隐私(ϵ=1.3\epsilon =1.3)仅引发总计累积奖励少至 5%5\% 的下降与计算时间 0.016%0.016\% 的增加。

关键词

引用

@article{arxiv.2309.12476,
  title  = {Differentially Private Reward Functions in Policy Synthesis for Markov Decision Processes},
  author = {Alexander Benvenuti and Calvin Hawkins and Brandon Fallin and Bo Chen and Brendan Bialy and Miriam Dennis and Matthew Hale},
  journal= {arXiv preprint arXiv:2309.12476},
  year   = {2024}
}

备注

16 Pages, 11 figures