符号网络:关系型马尔可夫决策过程的广义神经策略
机器学习
2020-06-30 v2 人工智能
机器学习
摘要
关系型马尔可夫决策过程(RMDP)是一种一阶表示,用于表达具有可能无界数量对象的单一概率规划领域的所有实例。RMDP的早期工作输出广义(实例无关)一阶策略或值函数,作为一次性求解某领域所有实例的手段。遗憾的是,由于此类策略或值函数所用表示空间固有的局限性,这一研究方向成效有限。神经模型能否通过轻松表示更复杂的广义策略来提供缺失的一环,从而在某给定领域的所有实例上生效?我们提出SymNet,这是首个用于求解以RDDL概率规划语言表达的RMDP的神经方法。SymNet利用来自某领域的训练实例为该RDDL领域训练一组共享参数。对于每个实例,SymNet首先将其转换为实例图,然后使用关系神经模型计算节点嵌入。随后,它将每个基动作评分为一阶动作符号及与该动作相关节点嵌入的函数。给定来自同一领域的新测试实例,具有预训练参数的SymNet架构对每个基动作评分并选择最优动作。这可在单次前向传播中完成,无需在测试实例上重新训练,从而隐式表示该领域的神经广义策略。我们在IPPC的九个RDDL领域上的实验表明,SymNet策略显著优于随机策略,有时甚至比从头训练最先进的深度反应式策略更有效。
引用
@article{arxiv.2002.07375,
title = {Symbolic Network: Generalized Neural Policies for Relational MDPs},
author = {Sankalp Garg and Aniket Bajpai and Mausam},
journal= {arXiv preprint arXiv:2002.07375},
year = {2020}
}
备注
In Proceeding of ICML 2020. Code can be found at https://github.com/dair-iitd/symnet