你的 RL 智能体如何探索?基于最优传输分析的占有率测度轨迹
机器学习
2024-10-17 v2
摘要
强化学习的不断进步,得益于将聪明的算法策略与深度架构结合,以优化回报和访问在状态-动作空间中的分布。目前缺乏量化框架来比较这些多样化 RL 算法的学习过程,这在实际中是所需的。我们通过将 RL 算法的学习过程表示为在训练期间生成的政策序列,来弥补这一差距,并研究在状态-动作占有率测度的流形中所引发的政策轨迹。使用最优传输基于度量衡量 RL 算法所产生的政策序列在初始政策与最终最优政策之间路径的长度。因此,我们首先定义“顺序学习努力”(ESL)。ESL 表示 RL 算法比从初始到最优政策的最短路径所遍历的相对距离。进一步,我们通过定义“最优运动比率”(OMR)将占有率测度空间中的政策动力学与后悔(另一种衡量 RL 算法次优性的度量)联系起来。OMR 评估占有率测度空间中有效减少类似后悔的运动比例。最后,我们推导了使用有限样本数且无需访问最优政策来估计 ESL 和 OMR 的近似保证。通过在各种环境和算法中的经验分析,我们展示 ESL 和 OMR 提供了关于 RL 算法探索过程以及不同任务离散和连续 MDP 中难度的见解。
引用
@article{arxiv.2402.09113,
title = {How does Your RL Agent Explore? An Optimal Transport Analysis of Occupancy Measure Trajectories},
author = {Reabetswe M. Nkhumise and Debabrota Basu and Tony J. Prescott and Aditya Gilra},
journal= {arXiv preprint arXiv:2402.09113},
year = {2024}
}