用于无模型强化学习的二次 actor 网络
机器学习
2021-03-12 v1 人工智能
机器人学
摘要
本文讨论了在无模型 actor-critic 强化学习背景下将二次神经元引入策略网络的方法。与通过激活函数引入非线性的常规方法不同,二次神经元支持显式的二次函数逼近。我们在多个 MuJoCo 连续控制任务上进行了实证实验,发现当将二次神经元加入 MLP 策略网络时,其性能优于基线 MLP,且所需参数更少。返回奖励的均值提升了 ,同时样本效率约提高 。此外,在面对增加的动作与观测噪声时,它仍能保持其优势。
引用
@article{arxiv.2103.06617,
title = {A Quadratic Actor Network for Model-Free Reinforcement Learning},
author = {Matthias Weissenbacher and Yoshinobu Kawahara},
journal= {arXiv preprint arXiv:2103.06617},
year = {2021}
}
备注
8 pages, 15 figures