差分隐私策略优化的样本复杂度
机器学习
2026-05-14 v3 人工智能
摘要
策略优化(PO)是现代强化学习(RL)的基石,广泛应用于机器人、医疗和大型语言模型训练等领域。然而,随着 PO 在敏感领域的日益普及,隐私关注问题日益突出。本文聚焦于差分隐私策略优化的样本复杂度,开启了该领域的理论研究。我们首先针对 PO 制定了合适的差分隐私定义,解决了基于 on-policy 学习动态和隐私单位定义的内在挑战。随后,我们在统一框架下系统分析了在差分隐私约束下的各种常用 PO 算法的样本复杂度,包括策略梯度(PG)、自然策略梯度(NPG)等。我们的理论结果表明,隐私成本常常表现为样本复杂度中的次要项,同时也揭示了私有 PO 环境下的一些细微却重要的观察。这些发现为隐私保护的 PO 算法提供了宝贵的实践见解。
引用
@article{arxiv.2510.21060,
title = {On the Sample Complexity of Differentially Private Policy Optimization},
author = {Yi He and Xingyu Zhou},
journal= {arXiv preprint arXiv:2510.21060},
year = {2026}
}
备注
Accepted at NeurIPS 2025