一种用于通用策略优化的解析更新规则
人工智能
2022-07-18 v4
摘要
我们提出一种独立于参数化函数逼近器的解析策略更新规则。该策略更新规则适用于优化通用随机策略,并具有单调改进保证。它源自使用变分法对信赖域优化的闭式解,遵循一项新的理论结果,该结果收紧了现有基于信赖域方法的策略改进界。该更新规则在策略搜索方法与值函数方法之间建立了联系。此外,由于无需计算对_on-policy_状态上的积分,离策略强化学习算法可由该更新规则导出。另外,当策略更新由智能体逐一执行时,该更新规则可立即推广至协作多智能体系统。
引用
@article{arxiv.2112.02045,
title = {An Analytical Update Rule for General Policy Optimization},
author = {Hepeng Li and Nicholas Clavette and Haibo He},
journal= {arXiv preprint arXiv:2112.02045},
year = {2022}
}