中文

用于文本游戏中策略性探索的多阶段情景控制

计算与语言 2022-03-17 v3

摘要

文本冒险游戏由于其组合巨大的动作空间和稀疏奖励,对强化学习方法提出了独特的挑战。这两个因素的相互作用尤其苛刻,因为巨大的动作空间需要广泛的探索,而稀疏奖励提供的反馈有限。本工作提出使用一种多阶段方法来解决探索与利用的困境,该方法在每个情景中显式解耦这两种策略。我们的算法称为 eXploit-Then-eXplore (XTX),在每个情景开始时使用利用策略来模仿过去一组有前景的轨迹,然后切换到旨在发现导致未见状态空间的新颖动作探索策略。这种策略分解使我们能够结合关于游戏空间中哪些部分需要返回的全局决策,以及在该空间中基于好奇心的局部探索,其动机源于人类可能如何接近这些游戏。我们的方法在 Jericho 基准(Hausknecht 等人,2020)的 12 个游戏中,分别在确定性和随机性设置下,平均归一化分数显著优于先前方法 27% 和 11%。特别是在 Zork1 游戏中,XTX 获得了 103 分,比先前方法提高超过 2 倍,并突破了困扰先前最先进方法的游戏中几个已知瓶颈。

关键词

引用

@article{arxiv.2201.01251,
  title  = {Multi-Stage Episodic Control for Strategic Exploration in Text Games},
  author = {Jens Tuyls and Shunyu Yao and Sham Kakade and Karthik Narasimhan},
  journal= {arXiv preprint arXiv:2201.01251},
  year   = {2022}
}

备注

ICLR 2022 (Spotlight) - https://sites.google.com/princeton.edu/xtx