中文

基于核求积的策略梯度

机器学习 2026-04-23 v2 人工智能

摘要

在广泛的强化学习任务中,回合(episode)的奖励评估成为瓶颈。本文的目标是,从大批量回合中选择一个小但具代表性的子集,仅在该子集上实际计算奖励,以实现更高效的策略梯度迭代。我们建立折扣回报或奖励的高斯过程建模,以导出回合空间上的正定核,运行“回合式”核求积方法压缩样本回合的信息,并将约简后的回合传给策略网络进行梯度更新。我们给出该过程的数学理论基础及其在 MuJoCo 任务中的数值说明。

关键词

引用

@article{arxiv.2310.14768,
  title  = {Policy Gradient with Kernel Quadrature},
  author = {Satoshi Hayakawa and Tetsuro Morimura},
  journal= {arXiv preprint arXiv:2310.14768},
  year   = {2026}
}

备注

18 pages, 2 figures