中文

我们尝试的方法效果不佳:强化学习中的指示表征

机器学习 2013-01-07 v1 人工智能

摘要

大多数强化学习方法基于世界状态的命题表征进行操作。此类表征通常规模庞大且难以处理,泛化能力较差。使用指示表征被认为是一种可行的替代方案:它们有望实现泛化,同时允许使用现有的强化学习方法。然而,文献中关于使用指示表征进行学习的实验报道甚少。本文在一个简单的积木世界领域中,探索了两种形式的指示表征和一种朴素的命题表征的有效性。我们通过实验发现,指示表征实际上恶化了学习性能。最后,我们讨论了这些结果的可能原因,以及在包含对象的领域中实现更有效学习的策略。

关键词

引用

@article{arxiv.1301.0567,
  title  = {The Thing That We Tried Didn't Work Very Well : Deictic Representation in Reinforcement Learning},
  author = {Sarah Finney and Natalia Gardiol and Leslie Pack Kaelbling and Tim Oates},
  journal= {arXiv preprint arXiv:1301.0567},
  year   = {2013}
}

备注

Appears in Proceedings of the Eighteenth Conference on Uncertainty in Artificial Intelligence (UAI2002)