中文

基于约束惩罚度量网络的外部惩罚策略优化

机器学习 2024-07-23 v1 机器人学

摘要

在受约束强化学习(CRL)中,智能体探索环境以学习满足约束条件的 optimal policy。惩罚函数方法最近作为处理约束的有效方法受到关注,这种方法对目标施加约束惩罚,将受约束问题转化为无约束问题。然而,选择合适的惩罚以有效平衡策略性能和约束满足性仍然具有挑战性。本文提出一种具有理论保障的惩罚函数方法:外部惩罚策略优化(EPO),其由自适应惩罚生成的惩罚度量网络(PMN)产生。PMN 对约束违反程度作出适当响应,从而实现高效的约束满足和安全探索。我们在理论上证明 EPO 在收敛性保证下持续改善约束满足情况。我们提出了新的代理函数,并提供了最坏情况的约束违反和近似误差。在实际中,我们提出一种有效的光滑惩罚函数,可轻松地与一阶优化器实现。进行大量实验,表明 EPO 在策略性能和约束满足性方面优于基线方法,并在训练过程中保持稳定,尤其是在复杂任务上表现突出。

关键词

引用

@article{arxiv.2407.15537,
  title  = {Exterior Penalty Policy Optimization with Penalty Metric Network under Constraints},
  author = {Shiqing Gao and Jiaxin Ding and Luoyi Fu and Xinbing Wang and Chenghu Zhou},
  journal= {arXiv preprint arXiv:2407.15537},
  year   = {2024}
}

备注

To be published in the 33rd International Joint Conference on Artificial Intelligence (IJCAI 2024)