中文

EXPLORER:面向文本强化学习的探索导向推理

计算与语言 2024-03-19 v1 人工智能 计算机科学中的逻辑

摘要

文本游戏(TBGs)已成为重要的 NLP 任务集合,要求强化学习(RL)代理将自然语言理解与推理结合。代理试图解决此类任务的一个关键挑战是如何在多个游戏之间泛化,并在seen和unseen对象上表现良好。纯粹基于深度RL的方法在seen对象上可能表现良好,但在unseen对象上的表现不佳。注入常识的深度RL代理在unseen数据上可能表现更好;然而,其策略往往不可解释或难以迁移。为解决这些问题,本文提出了EXPLORER,这是一个用于文本强化学习的探索导向推理代理。EXPLORER是神经符号主义的,其依赖于用于探索的神经模块和用于开发的符号模块。它还能学习通用符号策略,在unseen数据上表现良好。我们的实验表明,EXPLORER在Text-World烹饪(TW-Cooking)和Text-World常识(TWC)游戏中超越了基线代理。

关键词

引用

@article{arxiv.2403.10692,
  title  = {EXPLORER: Exploration-guided Reasoning for Textual Reinforcement Learning},
  author = {Kinjal Basu and Keerthiram Murugesan and Subhajit Chaudhury and Murray Campbell and Kartik Talamadupula and Tim Klinger},
  journal= {arXiv preprint arXiv:2403.10692},
  year   = {2024}
}