中文

线性 MDP 中差分隐私探索的改进后悔界

机器学习 2022-06-24 v2

摘要

我们研究依赖于敏感数据(如医疗记录)的环境中的序列决策隐私保护探索。特别地,我们专注于在线性 MDP 设定下解决受(联合)差分隐私约束的强化学习(RL)问题,其中动力学和奖励均由线性函数给出。Luyo 等人(2021)关于该问题的先前工作取得的后悔率对回合数量 KK 具有 O(K3/5)O(K^{3/5}) 的依赖。我们提供了一种隐私算法,其后悔率得到改进,对回合数量具有最优的 O(K)O(\sqrt{K}) 依赖。我们更强后悔保证的关键在于策略更新调度的自适应性,仅当检测到数据发生足够变化时才进行更新。因此,我们的算法具有较低的切换代价,仅执行 O(log(K))O(\log(K)) 次更新,这大大减少了隐私噪声的量。最后,在隐私参数 ϵ\epsilon 为常数的最普遍隐私机制下,我们的算法产生可忽略的隐私代价——与现有的非隐私后悔界相比,由隐私带来的额外后悔出现在低阶项中。

关键词

引用

@article{arxiv.2202.01292,
  title  = {Improved Regret for Differentially Private Exploration in Linear MDP},
  author = {Dung Daniel Ngo and Giuseppe Vietri and Zhiwei Steven Wu},
  journal= {arXiv preprint arXiv:2202.01292},
  year   = {2022}
}

备注

13 pages of main text, 30 pages in total; typo corrected, references added