基于观测历史的离线强化学习:样本复杂度的分析与改进
机器学习
2023-11-01 v1 人工智能
摘要
离线强化学习(RL)原则上可以仅由次优试验组成的数据集中综合出更优的行为。可能发生这种情况的一种方式是将重叠于相似状态上的其他次优轨迹的最佳部分“拼接”在一起,以创建每个单独状态都在分布内但总体回报更高的新行为。然而,在许多有趣且复杂的应用中,例如自主导航和对话系统,状态是部分可观测的。更糟的是,状态表示未知或不易定义。在此类情况下,策略和值函数通常基于观测历史而非状态进行条件化。在这些情况下,尚不清楚在观测历史层面上进行同种“拼接”是否可行,因为两条不同轨迹总是具有不同历史,因此可能导致有效拼接的“相似状态”无法被利用。理论上,我们表明基于观测历史进行条件化的标准离线RL算法承受较差的样本复杂度,与上述直觉一致。然后我们确定了离线RL仍可有效率的充分条件——直观上,它需要学习仅包含与动作选择相关特征的历史的紧凑表示。我们引入了一个双模拟损失来刻画这一现象发生的程度,并提议离线RL可显式优化该损失以改善最坏情况样本复杂度。经验上,我们表明在各种任务中,要么我们提出的损失提升了性能,要么该损失的值已作为标准离线RL的结果被最小化,表明其与良好性能密切相关。
引用
@article{arxiv.2310.20663,
title = {Offline RL with Observation Histories: Analyzing and Improving Sample Complexity},
author = {Joey Hong and Anca Dragan and Sergey Levine},
journal= {arXiv preprint arXiv:2310.20663},
year = {2023}
}
备注
21 pages, 4 figures