PrivORL:离线强化学习的差分隐私合成数据集
密码学与安全
2025-12-17 v2 机器学习
摘要
最近,离线强化学习(RL)已成为一种流行的RL范式。在离线RL中,数据提供者共享预先收集的数据集——可以是单个转移或形成轨迹的转移序列——以实现RL模型(也称为智能体)的训练,而无需与环境进行直接交互。离线RL节省了与环境的交互,并且在导航任务等关键领域已被证明有效。与此同时,关于离线RL数据集中隐私泄露的担忧已经出现。为了保护离线RL数据集中的私人信息,我们提出了首个差分隐私(DP)离线数据集合成方法PrivORL,该方法利用扩散模型和扩散Transformer分别合成转移和轨迹。合成数据集随后可以安全地发布用于下游分析和研究。PrivORL采用在公共数据集上预训练合成器,然后使用差分隐私随机梯度下降(DP-SGD)在敏感数据集上进行微调的流行方法。此外,PrivORL引入了好奇心驱动的预训练,该方法利用好奇心模块的反馈来多样化合成数据集,从而能够生成与敏感数据集密切相似的多样化合成转移和轨迹。我们在五个敏感离线RL数据集上进行了广泛实验,结果表明我们的方法在DP转移和轨迹合成方面均优于基线方法,在效用和保真度上均有提升。复制包可在GitHub仓库中获取。
引用
@article{arxiv.2512.07342,
title = {PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning},
author = {Chen Gong and Zheng Liu and Kecen Li and Tianhao Wang},
journal= {arXiv preprint arXiv:2512.07342},
year = {2025}
}
备注
Accepted at NDSS 2026; code available at https://github.com/2019ChenGong/PrivORL