中文

软件定义 MDP 的通用策略

人工智能 2020-12-22 v1 编程语言

摘要

我们引入一种称为预言机引导决策编程的新编程范式,其中程序指定一个马尔可夫决策过程(MDP),语言提供通用策略。我们原型化了一种新编程语言 Dodona,以代表非确定性选择的原语“choose”实现该范式。Dodona 解释器返回一个值或一个选择点,后者包含原则上做出最优决策所需的全部信息的无损编码。元解释器在这些选择点上查询 Dodona 的(神经)预言机以获取策略与价值估计,并用以在底层 MDP 上执行启发式搜索。我们通过在数百个模拟列表、树、Church 数据结构、多项式、一阶项与高阶项基本操作的合成任务上元学习,展示了 Dodona 的零样本启发式引导潜力。

关键词

引用

@article{arxiv.2012.11401,
  title  = {Universal Policies for Software-Defined MDPs},
  author = {Daniel Selsam and Jesse Michael Han and Leonardo de Moura and Patrice Godefroid},
  journal= {arXiv preprint arXiv:2012.11401},
  year   = {2020}
}