具有线性表示的强化学习中的差分隐私探索
机器学习
2021-12-08 v2
摘要
本文研究具有线性表示的马尔可夫决策过程(MDPs)中的隐私保护探索。我们首先考虑线性混合 MDPs(Ayoub 等,2020)(即基于模型设置)的设置,并提供用于分析联合与局部差分隐私(DP)探索的统一框架。通过该框架,我们证明了 -局部 DP 探索的 后悔界,以及 -联合 DP 的 后悔界。我们进一步研究线性 MDPs(Jin 等,2020)(即无模型设置)中的隐私保护探索,其中我们基于低切换的新算法为 -联合 DP 提供了 后悔界。最后,我们对该无模型设置中设计局部 DP 算法的问题提供了见解。
引用
@article{arxiv.2112.01585,
title = {Differentially Private Exploration in Reinforcement Learning with Linear Representation},
author = {Paul Luyo and Evrard Garcelon and Alessandro Lazaric and Matteo Pirotta},
journal= {arXiv preprint arXiv:2112.01585},
year = {2021}
}