中文

具有线性表示的强化学习中的差分隐私探索

机器学习 2021-12-08 v2

摘要

本文研究具有线性表示的马尔可夫决策过程(MDPs)中的隐私保护探索。我们首先考虑线性混合 MDPs(Ayoub 等,2020)(即基于模型设置)的设置,并提供用于分析联合与局部差分隐私(DP)探索的统一框架。通过该框架,我们证明了 (ϵ,δ)(\epsilon,\delta)-局部 DP 探索的 O~(K3/4/ϵ)\widetilde{O}(K^{3/4}/\sqrt{\epsilon}) 后悔界,以及 (ϵ,δ)(\epsilon,\delta)-联合 DP 的 O~(K/ϵ)\widetilde{O}(\sqrt{K/\epsilon}) 后悔界。我们进一步研究线性 MDPs(Jin 等,2020)(即无模型设置)中的隐私保护探索,其中我们基于低切换的新算法为 (ϵ,δ)(\epsilon,\delta)-联合 DP 提供了 O~(K35/ϵ25)\widetilde{O}\left(K^{\frac{3}{5}}/\epsilon^{\frac{2}{5}}\right) 后悔界。最后,我们对该无模型设置中设计局部 DP 算法的问题提供了见解。

关键词

引用

@article{arxiv.2112.01585,
  title  = {Differentially Private Exploration in Reinforcement Learning with Linear Representation},
  author = {Paul Luyo and Evrard Garcelon and Alessandro Lazaric and Matteo Pirotta},
  journal= {arXiv preprint arXiv:2112.01585},
  year   = {2021}
}