基于核求积的策略梯度
机器学习
2026-04-23 v2 人工智能
摘要
在广泛的强化学习任务中,回合(episode)的奖励评估成为瓶颈。本文的目标是,从大批量回合中选择一个小但具代表性的子集,仅在该子集上实际计算奖励,以实现更高效的策略梯度迭代。我们建立折扣回报或奖励的高斯过程建模,以导出回合空间上的正定核,运行“回合式”核求积方法压缩样本回合的信息,并将约简后的回合传给策略网络进行梯度更新。我们给出该过程的数学理论基础及其在 MuJoCo 任务中的数值说明。
引用
@article{arxiv.2310.14768,
title = {Policy Gradient with Kernel Quadrature},
author = {Satoshi Hayakawa and Tetsuro Morimura},
journal= {arXiv preprint arXiv:2310.14768},
year = {2026}
}
备注
18 pages, 2 figures