基于仅状态演示的平滑引导策略优化
机器学习
2024-10-28 v3
摘要
奖励反馈的稀疏性仍然是在线深度强化学习中的一个挑战性问题。先前的方法利用离线演示在多个困难任务中取得了令人印象深刻的结果。然而,这些方法对演示质量要求很高,获取专家级动作通常成本高昂且不现实。为了解决这些问题,我们提出了一种简单高效的算法,称为平滑引导策略优化,该算法利用少量仅状态演示(演示中不包含专家动作信息)来间接进行近似且可行的长期信用分配并促进探索。具体来说,我们首先设计了一个轨迹重要性评估机制,以确定当前轨迹相对于演示的质量。然后,我们引入了一种基于轨迹重要性的引导奖励计算技术,用于衡量每个状态-动作对的影响,将演示者的状态分布与奖励信息融合到引导奖励中。我们从理论上分析了平滑引导奖励带来的性能提升,并推导出性能提升的一个新的最坏情况下限。大量结果表明,POSG在四个稀疏奖励环境(包括网格世界迷宫、Hopper-v4、HalfCheetah-v4和Ant迷宫)中在控制性能和收敛速度方面具有显著优势。值得注意的是,我们研究了具体的指标和可量化结果,以证明POSG的优越性。
引用
@article{arxiv.2401.00162,
title = {Policy Optimization with Smooth Guidance Learned from State-Only Demonstrations},
author = {Guojian Wang and Faguo Wu and Xiao Zhang and Tianyuan Chen},
journal= {arXiv preprint arXiv:2401.00162},
year = {2024}
}
备注
31 pages, 23 figures; This work has been submitted to the IEEE for possible publication