episodic 马尔可夫决策过程中的差分隐私遗憾最小化
机器学习
2021-12-21 v1 密码学与安全
概率论
摘要
我们在差分隐私(DP)约束下研究有限时域表格马尔可夫决策过程(MDPs)中的遗憾最小化。其动机在于强化学习(RL)在现实世界序贯决策问题中的广泛应用,其中保护用户的敏感与隐私信息正变得至关重要。我们考虑 DP 的两种变体——联合 DP(JDP),即一个中心化智能体负责保护用户敏感数据;以及本地 DP(LDP),即信息需在用户端直接受保护。我们首先提出两个通用框架——一个用于策略优化,另一个用于值迭代——以设计隐私保护的乐观 RL 算法。随后我们以合适的隐私机制实例化这些框架,以满足 JDP 与 LDP 要求,同时获得次线性遗憾保证。遗憾界表明,在 JDP 下隐私的代价仅为低阶加性项,而在 LDP 下更强的隐私保护所承受的代价则是乘性的。最后,遗憾界由统一分析获得,我们相信该分析可推广至表格 MDPs 之外。
引用
@article{arxiv.2112.10599,
title = {Differentially Private Regret Minimization in Episodic Markov Decision Processes},
author = {Sayak Ray Chowdhury and Xingyu Zhou},
journal= {arXiv preprint arXiv:2112.10599},
year = {2021}
}
备注
Accepted by AAAI 2022