脂到薄策略优化:稀疏策略的离线强化学习
机器学习
2025-01-27 v1
摘要
稀疏连续策略是指能够随机选择某些动作且对其他动作严格保持零概率的分布,这与高斯分布截然不同。它们在现实世界中具有重要意义,例如在医学等安全关键任务建模中。离线强化学习与稀疏策略的结合提供了一种新范式,使可从已记录数据集中完全学习出安全感知的稀疏策略。然而,稀疏策略可能导致现有离线算法在评估超出当前支持范围的动作时出现困难。本文提出了首个解决这一挑战的离线策略优化算法:脂到薄策略优化 (Fat-to-Thin Policy Optimization, FtTPO)。具体而言,我们维持一个 fat(厚重尾)提议策略,以有效从数据集中学习并向负责与环境交互的 thin(稀疏)策略注入知识。我们以通用的 -Gaussian 族实现 FtTPO,后者包含厚重尾和稀疏策略,并在安全关键的治疗模拟和标准 MuJoCo 套件中验证其优势。我们的代码可在 \url{https://github.com/lingweizhu/fat2thin} 查阅。
引用
@article{arxiv.2501.14373,
title = {Fat-to-Thin Policy Optimization: Offline RL with Sparse Policies},
author = {Lingwei Zhu and Han Wang and Yukie Nagai},
journal= {arXiv preprint arXiv:2501.14373},
year = {2025}
}
备注
accepted by ICLR 2025; code available at https://github.com/lingweizhu/fat2thin