符号推理领域的对比强化学习
人工智能
2021-11-09 v2 机器学习
摘要
抽象符号推理,如数学与逻辑领域中所要求的,是人类智能的关键组成部分。这些领域的求解器具有重要应用,特别是对计算机辅助教育而言。但学习求解符号问题对机器学习算法而言具有挑战性。现有模型或从人类解法中学习,或使用手工设计特征,使其在新领域中的应用代价高昂。在本文中,我们转而将符号领域视为简单环境,其中状态与动作以非结构化文本给出,二元奖励指示问题是否被解决。这一灵活设定使指定新领域变得容易,但搜索与规划变得困难。我们引入了受数学共同核心课程启发的四个环境,并观察到现有强化学习基线表现糟糕。随后我们提出一种新颖学习算法,对比策略学习(ConPoLe),其显式优化 InfoNCE 损失,该损失是当期状态与沿求解路径继续的下一状态之间互信息的下界。ConPoLe 成功求解全部四个领域。此外,ConPoLe 学到的题目表示能够准确预测真实数学课程中题目的类别。我们的结果指出了符号领域强化学习的新方向,以及对数学教育的应用。
引用
@article{arxiv.2106.09146,
title = {Contrastive Reinforcement Learning of Symbolic Reasoning Domains},
author = {Gabriel Poesia and WenXin Dong and Noah Goodman},
journal= {arXiv preprint arXiv:2106.09146},
year = {2021}
}
备注
NeurIPS 2021