中文

快照强化学习:利用先验轨迹提高效率

机器学习 2024-03-13 v2

摘要

深度强化学习 (DRL) 算法需要大量的样本和计算资源才能实现更高的性能,这限制了其实际应用并对进一步发展构成了挑战。鉴于资源有限的约束,利用现有的计算工作(例如已学习的策略、样本)来提高样本效率并减少 DRL 算法的计算资源消耗至关重要。以往利用现有计算工作的研究需要对现有算法和模型进行侵入式修改,且专为特定算法设计,缺乏灵活性和通用性。在本文中,我们提出了快照强化学习 (SnapshotRL) 框架,该框架通过简单地改变环境来提高样本效率,而无需对算法和模型进行任何修改。通过允许学生智能体选择教师轨迹中的状态作为初始采样状态,SnapshotRL 能够有效利用教师轨迹辅助学生智能体训练,使学生智能体在训练早期阶段探索更大的状态空间。我们提出了一种简单有效的 SnapshotRL 基线算法 S3RL,它能与现有的 DRL 算法良好集成。我们的实验表明,在 MuJoCo 基准测试中将 S3RL 与 TD3、SAC 和 PPO 算法集成,显著提高了样本效率和平均回报,且无需额外样本和额外计算资源。

关键词

引用

@article{arxiv.2403.00673,
  title  = {Snapshot Reinforcement Learning: Leveraging Prior Trajectories for Efficiency},
  author = {Yanxiao Zhao and Yangge Qian and Tianyi Wang and Jingyang Shan and Xiaolin Qin},
  journal= {arXiv preprint arXiv:2403.00673},
  year   = {2024}
}

备注

Under review