中文

通过程序合成进行数学推理的强化学习环境

机器学习 2021-07-19 v2 人工智能

摘要

我们通过将 DeepMind 数学数据集解释为程序合成问题,将其转化为一个强化学习环境。环境中采取的每个动作向一个离散计算图中添加一个算子或输入。计算出正确结果的图产生正奖励,从而能够优化策略以根据问题陈述构建计算图。使用 Double DQN 在各种问题类型子集上训练基线模型,展示了尽管存在组合爆炸和噪声奖励的挑战,仍能学会正确构建图的能力。

关键词

引用

@article{arxiv.2107.07373,
  title  = {A Reinforcement Learning Environment for Mathematical Reasoning via Program Synthesis},
  author = {Joseph Palermo and Johnny Ye and Alok Singh},
  journal= {arXiv preprint arXiv:2107.07373},
  year   = {2021}
}