优化更宽而非更深:基于共识聚合的政策优化
机器学习
2026-03-16 v1 人工智能
摘要
近端策略优化(PPO)通过多轮 clipped SGD 来近似信任区域更新。每一轮可能会导致偏离自然梯度方向的漂移,产生路径依赖的噪声。为理解这种漂移,我们可利用 Fisher 信息几何将政策更新分解为信号(自然梯度投影)和浪费(Fisher 正交残差,该残差会消耗信任区域预算但不产生一阶近似改进)。经验上,信号会饱和,而浪费随额外轮数而增长,形成优化深度的困境。我们提出基于共识聚合的政策优化(Consensus Aggregation for Policy Optimization, CAPO),其将计算从深度转向宽度:K 个 PPO 复制在同一批数据上优化,仅在 mini-batch 排序上存在差异,然后聚合为共识。我们研究两种空间上的聚合:欧几里得参数空间,以及通过对数意见池实现的政策分布自然参数空间。在自然参数空间中,共识可在 KL 惩罚的单极化函数和更紧致的信任区域合规性方面,证实地优于单个专家;参数平均会在近似程度上继承这些保证。在连续控制任务中,CAPO 在固定样本预算下,以最高可达 8.6 倍的性能优于 PPO 和计算匹配的更深基线。CAPO 表明,政策优化可以通过优化更宽的模型来提升,而无需额外的环境交互。
引用
@article{arxiv.2603.12596,
title = {Optimize Wider, Not Deeper: Consensus Aggregation for Policy Optimization},
author = {Zelal Su and Mustafaoglu and Sungyoung Lee and Eshan Balachandar and Risto Miikkulainen and Keshav Pingali},
journal= {arXiv preprint arXiv:2603.12596},
year = {2026}
}