基于状态-动作相似性的离屏策略评估表示
机器学习
2023-10-31 v1
摘要
在强化学习中,离屏策略评估(OPE)是指在给定由运行一个或多个不同策略所收集的固定数据集的情况下,估计评估策略期望回报的问题。OPE 中较具经验成功性的算法之一是拟合 q 评估(FQE)算法,它使用时序差分更新来学习动作值函数,并用以估计评估策略的期望回报。通常,原始固定数据集被直接输入 FQE 以学习评估策略的动作值函数。相反,在本文中,我们寻求首先使用学习到的编码器变换固定数据集,然后将变换后的数据集输入 FQE,从而增强 FQE 的数据效率。为学习这样的编码器,我们引入了专为 OPE 定制的状态-动作行为相似性度量,并利用该度量和固定数据集学习对该度量建模的编码器。理论上,我们证明该度量允许我们界定所得 OPE 估计中的误差。在经验上,我们表明其他状态-动作相似性度量会导致无法表示评估策略动作值函数的表示,且我们的状态-动作表示方法在具有挑战性的 OPE 任务上提升了 FQE 的数据效率并降低了相对于其他基于 OPE 的表示学习方法的 OPE 误差。我们还通过经验表明,所学表示显著缓解了 FQE 在不同分布偏移下的发散。我们的代码可在此获取:https://github.com/Badger-RL/ROPE。
引用
@article{arxiv.2310.18409,
title = {State-Action Similarity-Based Representations for Off-Policy Evaluation},
author = {Brahma S. Pavse and Josiah P. Hanna},
journal= {arXiv preprint arXiv:2310.18409},
year = {2023}
}
备注
Accepted to Neural Information Processing Systems (NeurIPS) 2023