线性 MDP 中的最优差分隐私 regret 界限
机器学习
2025-04-29 v2 数据结构与算法
机器学习
摘要
我们研究在episodic inhomogeneous linear Markov决策过程 (MDP) 中受隐私约束下的regret最小化,动机来自强化学习 (RL) 在依赖敏感用户数据的个性化决策系统中日益增长的应用。在此设置下,假设转移概率和奖励函数均线性关联于特征映射 ,旨在通过联合差分隐私 (JDP) 实现隐私,该方法是适用于在线学习的差分隐私松化形式。先前工作通过对 LSVI-UCB 算法进行隐私化处理,建立了次优regret界限,LSVI-UCB 在无隐私设置下实现 的regret。基于近期进展将其优化到接近 minimax 最优regret 的 LSVI-UCB++ 采用巨文方法奖励,本文设计了新的差分隐私算法,通过对 LSVI-UCB++ 进行隐私化处理并引入来自离线 RL 的方差感知分析技术。我们的算法获得 的regret界限,优于先前私有方法。实验结果表明,我们的算法在接近最优实用性方面保持了与非私有基线的接近程度,表明在此设置下可实现隐私且性能几乎不受影响。
引用
@article{arxiv.2504.09339,
title = {Towards Optimal Differentially Private Regret Bounds in Linear MDPs},
author = {Sharan Sahu},
journal= {arXiv preprint arXiv:2504.09339},
year = {2025}
}
备注
28 pages, 2 figures