中文

episodic 马尔可夫决策过程中的差分隐私遗憾最小化

机器学习 2021-12-21 v1 密码学与安全 概率论

摘要

我们在差分隐私(DP)约束下研究有限时域表格马尔可夫决策过程(MDPs)中的遗憾最小化。其动机在于强化学习(RL)在现实世界序贯决策问题中的广泛应用,其中保护用户的敏感与隐私信息正变得至关重要。我们考虑 DP 的两种变体——联合 DP(JDP),即一个中心化智能体负责保护用户敏感数据;以及本地 DP(LDP),即信息需在用户端直接受保护。我们首先提出两个通用框架——一个用于策略优化,另一个用于值迭代——以设计隐私保护的乐观 RL 算法。随后我们以合适的隐私机制实例化这些框架,以满足 JDP 与 LDP 要求,同时获得次线性遗憾保证。遗憾界表明,在 JDP 下隐私的代价仅为低阶加性项,而在 LDP 下更强的隐私保护所承受的代价则是乘性的。最后,遗憾界由统一分析获得,我们相信该分析可推广至表格 MDPs 之外。

关键词

引用

@article{arxiv.2112.10599,
  title  = {Differentially Private Regret Minimization in Episodic Markov Decision Processes},
  author = {Sayak Ray Chowdhury and Xingyu Zhou},
  journal= {arXiv preprint arXiv:2112.10599},
  year   = {2021}
}

备注

Accepted by AAAI 2022