LPPG-RL:基于 lexicographic 投影的策略梯度强化学习与子问题探索
机器学习
2025-11-12 v1 人工智能
摘要
包含多个具有明确优先级的相互冲突子任务的 lexicographic 多目标问题在现实应用中十分常见。尽管强化学习(RL)在单个任务中表现出优势,但将传统RL方法扩展到优先级多个目标仍面临挑战。特别是,传统的安全RL和多目标RL(MORL)方法在高效执行优先级排序方面存在困难。因此,develop 了 lexicographic 多目标RL(LMORL)方法以应对这些挑战。然而,现有LMORL方法要么依赖带有先验知识的启发式阈值调优,要么受限于离散域。为克服这些局限性,我们提出 lexicographic 投影策略梯度强化学习(LPPG-RL),一种新的LMORL框架,利用顺序梯度投影识别可行的策略更新方向,从而使LPPG-RL能够与所有基于策略梯度的算法在连续空间中广泛兼容。LPPG-RL将投影步骤重新表述为优化问题,并利用Dykstra投影而非通用求解器实现显著加速,尤其适用于小型至中型实例。在此基础上,LPPG-RL引入子问题探索(SE),以防止梯度消失、加快收敛并提升稳定性。我们为收敛性提供了理论保证,并给出策略改进的下界。最后,通过在2D导航环境中的大量实验,我们展示了LPPG-RL的有效性,表明其优于现有最先进的连续LMORL方法。
引用
@article{arxiv.2511.08339,
title = {LPPG-RL: Lexicographically Projected Policy Gradient Reinforcement Learning with Subproblem Exploration},
author = {Ruiyu Qiu and Rui Wang and Guanghui Yang and Xiang Li and Zhijiang Shao},
journal= {arXiv preprint arXiv:2511.08339},
year = {2025}
}