面向离线强化学习的样本内 Softmax
机器学习
2023-04-20 v2 人工智能
摘要
强化学习(RL)智能体可利用先前收集的数据批次提取合理的控制策略。然而,这一离线RL设定中一个新兴问题是,许多方法所依赖的自举更新受限于动作覆盖不足:标准max算子可能选出一个数据集中未出现的极大动作。从这些不准确值自举可导致过高估计甚至发散。现有越来越多方法试图近似仅使用数据集良好覆盖动作的\emph{样本内}max。我们强调一个简单事实:仅使用数据集中的动作来近似样本内\emph{softmax}更为直接。我们证明基于样本内softmax的策略迭代收敛,且随温度下降它逼近样本内max。我们推导出一种使用该样本内softmax的样本内Actor-Critic(AC),并表明其持续优于或与现有离线RL方法相当,且亦适于微调。
引用
@article{arxiv.2302.14372,
title = {The In-Sample Softmax for Offline Reinforcement Learning},
author = {Chenjun Xiao and Han Wang and Yangchen Pan and Adam White and Martha White},
journal= {arXiv preprint arXiv:2302.14372},
year = {2023}
}