软件定义 MDP 的通用策略
人工智能
2020-12-22 v1 编程语言
摘要
我们引入一种称为预言机引导决策编程的新编程范式,其中程序指定一个马尔可夫决策过程(MDP),语言提供通用策略。我们原型化了一种新编程语言 Dodona,以代表非确定性选择的原语“choose”实现该范式。Dodona 解释器返回一个值或一个选择点,后者包含原则上做出最优决策所需的全部信息的无损编码。元解释器在这些选择点上查询 Dodona 的(神经)预言机以获取策略与价值估计,并用以在底层 MDP 上执行启发式搜索。我们通过在数百个模拟列表、树、Church 数据结构、多项式、一阶项与高阶项基本操作的合成任务上元学习,展示了 Dodona 的零样本启发式引导潜力。
引用
@article{arxiv.2012.11401,
title = {Universal Policies for Software-Defined MDPs},
author = {Daniel Selsam and Jesse Michael Han and Leonardo de Moura and Patrice Godefroid},
journal= {arXiv preprint arXiv:2012.11401},
year = {2020}
}