利用超网络重组强化学习构建模块
机器学习
2021-06-15 v1 人工智能
摘要
强化学习(RL)的构建模块,即 Q 函数与策略网络,通常将来自两个域的笛卡尔积中的元素作为输入。具体而言,Q 函数的输入为状态与动作,而在多任务问题(元强化学习 Meta-RL)中策略可接收状态与上下文。标准架构往往忽略这些变量的底层含义,仅将其特征拼接为单一向量。本文认为,这种选择可能导致 actor-critic 算法中的梯度估计不佳,以及元强化学习算法中高方差的学习步。为考虑输入变量间的交互,我们建议使用超网络(Hypernetwork)架构,其中主网络决定条件动态网络的权重。我们表明该方法改善了梯度近似并降低了学习步方差,从而同时加速学习并提升最终性能。我们在不同运动控制任务及不同算法上展示了持续的性能提升,涵盖 RL(TD3 与 SAC)与 Meta-RL(MAML 与 PEARL)。
引用
@article{arxiv.2106.06842,
title = {Recomposing the Reinforcement Learning Building Blocks with Hypernetworks},
author = {Shai Keynan and Elad Sarafian and Sarit Kraus},
journal= {arXiv preprint arXiv:2106.06842},
year = {2021}
}
备注
ICML 2021