面向 RDDL 规划的与规模无关的神经网络迁移
机器学习
2019-04-08 v2 机器学习
摘要
RDDL MDP 的神经规划器以离线方式生成深度反应式策略。它们在大规模域上扩展性良好,但针对每个新问题从头训练样本效率低且耗时。为缓解此问题,近期研究探讨了神经迁移学习,使得在同一域的其他问题上训练出的通用规划器可快速迁移至新问题。然而,该方法仅能在相同规模的问题间迁移。我们提出首个可跨不同规模问题迁移 RDDL MDP 的神经迁移方法。我们的架构为实现规模无关性有两个关键创新:(1)状态编码器,通过对可变数量的对象嵌入进行最大池化输出定长状态嵌入;(2)单一参数绑定动作解码器,将对象嵌入投影为最终策略的动作概率。在 SysAdmin 与 Game Of Life 两个具挑战性的 RDDL 域上,我们的方法可强有力地跨问题规模迁移,并优于从头训练的学习曲线。
引用
@article{arxiv.1902.03081,
title = {Size Independent Neural Transfer for RDDL Planning},
author = {Sankalp Garg and Aniket Bajpai and Mausam},
journal= {arXiv preprint arXiv:1902.03081},
year = {2019}
}
备注
Published in ICAPS 2019