具有差分隐私评论家的 actor-critic 算法
机器学习
2019-10-15 v1 机器学习
摘要
强化学习算法以样本效率低而著称,并且通常可通过利用其他相关任务上的信息(例如通过预训练)来大幅改善某一任务上的性能。在这项工作中,我们提出了一种在智能体轨迹包含敏感或私密信息(如医疗领域)的情况下实现此类知识迁移的技术。我们的方法利用差分隐私策略评估算法来初始化 actor-critic 模型,并提升下游任务中的学习有效性。我们通过经验表明,该技术在保留上游任务所收集轨迹隐私的同时,提高了资源受限控制问题中的样本效率。
引用
@article{arxiv.1910.05876,
title = {Actor Critic with Differentially Private Critic},
author = {Jonathan Lebensold and William Hamilton and Borja Balle and Doina Precup},
journal= {arXiv preprint arXiv:1910.05876},
year = {2019}
}
备注
6 Pages, Presented at the Privacy in Machine Learning Workshop, NeurIPS 2019