通过程序合成进行数学推理的强化学习环境
机器学习
2021-07-19 v2 人工智能
摘要
我们通过将 DeepMind 数学数据集解释为程序合成问题,将其转化为一个强化学习环境。环境中采取的每个动作向一个离散计算图中添加一个算子或输入。计算出正确结果的图产生正奖励,从而能够优化策略以根据问题陈述构建计算图。使用 Double DQN 在各种问题类型子集上训练基线模型,展示了尽管存在组合爆炸和噪声奖励的挑战,仍能学会正确构建图的能力。
引用
@article{arxiv.2107.07373,
title = {A Reinforcement Learning Environment for Mathematical Reasoning via Program Synthesis},
author = {Joseph Palermo and Johnny Ye and Alok Singh},
journal= {arXiv preprint arXiv:2107.07373},
year = {2021}
}