中文

KFCPO:Kronecker-分解近似约束策略优化

机器学习 2025-11-04 v1 人工智能

摘要

我们提出了 KFCPO,一种新的安全强化学习 (Safe RL) 算法,将可扩展的 Kronecker-分解近似曲率 (K-FAC) 基于二阶策略优化与安全感知梯度操作相结合。KFCPO 利用 K-FAC 对自然梯度进行高效且稳定的更新,通过以层级方式、闭形式近似 Fisher 信息矩阵 (FIM) 来实现,从而避免迭代近似的开销。为解决奖励最大化与约束满足之间的权衡,我们引入一种边际感知梯度操作机制,该机制根据智能体接近安全边界的程度自适应调整奖励梯度和代价梯度的影响。该方法通过一种方向敏感的投影来混合梯度,消除有害干扰,避免固定硬阈值导致的突变。此外,采用小批量级 KL 回滚策略,以确保信任区域合规并防止不可稳定的策略偏移。在 OmniSafe 上进行的 Safety Gymnasium 实验表明,KFCPO 在环境中的平均回报提升了 10.3% 到 50.2%,显著优于遵守安全约束的最佳基线,展示了在安全性和性能之间取得优异平衡。

关键词

引用

@article{arxiv.2511.00880,
  title  = {KFCPO: Kronecker-Factored Approximated Constrained Policy Optimization},
  author = {Joonyoung Lim and Younghwan Yoo},
  journal= {arXiv preprint arXiv:2511.00880},
  year   = {2025}
}

备注

12 pages, 8 figures, submitted to ECAI 2025