中文

线性 MDP 中的最优差分隐私 regret 界限

机器学习 2025-04-29 v2 数据结构与算法 机器学习

摘要

我们研究在episodic inhomogeneous linear Markov决策过程 (MDP) 中受隐私约束下的regret最小化,动机来自强化学习 (RL) 在依赖敏感用户数据的个性化决策系统中日益增长的应用。在此设置下,假设转移概率和奖励函数均线性关联于特征映射 ϕ(s,a)\phi(s, a),旨在通过联合差分隐私 (JDP) 实现隐私,该方法是适用于在线学习的差分隐私松化形式。先前工作通过对 LSVI-UCB 算法进行隐私化处理,建立了次优regret界限,LSVI-UCB 在无隐私设置下实现 O~(d3H4K)\widetilde{O}(\sqrt{d^3 H^4 K}) 的regret。基于近期进展将其优化到接近 minimax 最优regret O~(dH3K)\widetilde{O}(d\sqrt{H^{3}K}) 的 LSVI-UCB++ 采用巨文方法奖励,本文设计了新的差分隐私算法,通过对 LSVI-UCB++ 进行隐私化处理并引入来自离线 RL 的方差感知分析技术。我们的算法获得 O~(dH3K+H15/4d7/6K1/2/ϵ)\widetilde{O}(d \sqrt{H^3 K} + H^{15/4} d^{7/6} K^{1/2} / \epsilon) 的regret界限,优于先前私有方法。实验结果表明,我们的算法在接近最优实用性方面保持了与非私有基线的接近程度,表明在此设置下可实现隐私且性能几乎不受影响。

关键词

引用

@article{arxiv.2504.09339,
  title  = {Towards Optimal Differentially Private Regret Bounds in Linear MDPs},
  author = {Sharan Sahu},
  journal= {arXiv preprint arXiv:2504.09339},
  year   = {2025}
}

备注

28 pages, 2 figures