TrajDeleter:在离线强化学习智能体中实现轨迹遗忘
机器学习
2024-09-04 v2 密码学与安全
摘要
强化学习(RL)通过与环境的交互经验来训练智能体。在在线交互不切实际的场景中,使用预先收集的数据集训练智能体的离线强化学习已变得流行。虽然这一新范式在医疗保健和能源管理等多个现实领域展现出显著的有效性,但越来越多的需求要求智能体能够快速且彻底地消除特定轨迹对训练数据集和已训练智能体的影响。针对这一问题,本文提出了 Trajdeleter,这是首个面向离线 RL 智能体的实用轨迹遗忘方法。Trajdeleter 的核心思想是引导智能体在遇到与遗忘轨迹相关的状态时表现出性能退化。同时,它确保智能体在面对其他剩余轨迹时保持其原有的性能水平。此外,我们引入了 Trajauditor,一种简单而有效的方法,用于评估 Trajdeleter 是否成功消除了离线 RL 智能体中特定轨迹的影响。在六种离线 RL 算法和三个任务上进行的广泛实验表明,Trajdeleter 仅需从头开始重新训练所需时间的约 1.5%。它平均能有效遗忘 94.8% 的目标轨迹,且在遗忘后的实际环境交互中依然表现良好。复现包和智能体参数已在线提供。
引用
@article{arxiv.2404.12530,
title = {TrajDeleter: Enabling Trajectory Forgetting in Offline Reinforcement Learning Agents},
author = {Chen Gong and Kecen Li and Jin Yao and Tianhao Wang},
journal= {arXiv preprint arXiv:2404.12530},
year = {2024}
}
备注
Accepted at NDSS 2025. The presented document here is the full version of our paper