具有重尾奖励的差分隐私情景式强化学习
机器学习
2023-06-06 v2 人工智能
摘要
在本文中,我们研究在差分隐私(DP)约束下具有重尾奖励的(有限 horizon 表格)马尔可夫决策过程(MDP)。与先前通常假设奖励从有界或次高斯分布中采样以确保 DP 的私有强化学习研究相比,我们考虑奖励分布仅具有某个 的有限 阶矩的设置。通过借助奖励的鲁棒均值估计器,我们首先提出针对重尾 MDP 的两个框架,即一个用于值迭代,另一个用于策略优化。在每个框架下,我们考虑联合差分隐私(JDP)和本地差分隐私(LDP)模型。基于我们的框架,我们给出了 JDP 和 LDP 情形的后悔上界,并表明分布矩与隐私预算均对后悔有显著影响。最后,我们通过将其归约为 DP 模型中重尾多臂老虎机的实例无关下界,建立了 JDP 模型中重尾 MDP 后悔最小化的下界。我们也通过采用一些私有极小极大方法给出了 LDP 中该问题的下界。我们的结果揭示了具有次高斯奖励与具有重尾奖励的私有 RL 问题之间存在根本差异。
引用
@article{arxiv.2306.01121,
title = {Differentially Private Episodic Reinforcement Learning with Heavy-tailed Rewards},
author = {Yulian Wu and Xingyu Zhou and Sayak Ray Chowdhury and Di Wang},
journal= {arXiv preprint arXiv:2306.01121},
year = {2023}
}
备注
ICML 2023