线性 MDP 中差分隐私探索的改进后悔界
机器学习
2022-06-24 v2
摘要
我们研究依赖于敏感数据(如医疗记录)的环境中的序列决策隐私保护探索。特别地,我们专注于在线性 MDP 设定下解决受(联合)差分隐私约束的强化学习(RL)问题,其中动力学和奖励均由线性函数给出。Luyo 等人(2021)关于该问题的先前工作取得的后悔率对回合数量 具有 的依赖。我们提供了一种隐私算法,其后悔率得到改进,对回合数量具有最优的 依赖。我们更强后悔保证的关键在于策略更新调度的自适应性,仅当检测到数据发生足够变化时才进行更新。因此,我们的算法具有较低的切换代价,仅执行 次更新,这大大减少了隐私噪声的量。最后,在隐私参数 为常数的最普遍隐私机制下,我们的算法产生可忽略的隐私代价——与现有的非隐私后悔界相比,由隐私带来的额外后悔出现在低阶项中。
引用
@article{arxiv.2202.01292,
title = {Improved Regret for Differentially Private Exploration in Linear MDP},
author = {Dung Daniel Ngo and Giuseppe Vietri and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:2202.01292},
year = {2022}
}
备注
13 pages of main text, 30 pages in total; typo corrected, references added