T-学习
机器学习
2012-01-04 v1
摘要
传统强化学习(RL)侧重于涉及许多状态和少量动作的问题,例如简单的网格世界。然而,大多数现实世界问题属于相反类型,涉及少量相关状态和大量动作。例如,为了从会议返回家中,人类只识别出少数几个子目标状态,如大厅、出租车、机场等。连接这两个状态的每个有效行为都可以被视为一个动作,并且有数万亿个这样的动作。假设子目标识别问题已经解决,在现实世界环境中,任何RL方法的质量更多地取决于它如何随动作数量扩展,而不是随状态数量扩展。这正是我们的新方法T-学习的优势所在,它通过以策略无关的方式评估从一个状态到另一个状态的相对较少的可能转移,而不是传统策略依赖方式中的大量状态-动作对或状态。说明性实验表明,T-学习相对于Q-学习的性能提升可以是任意大的。
引用
@article{arxiv.1201.0292,
title = {T-Learning},
author = {Vincent Graziano and Faustino Gomez and Mark Ring and Juergen Schmidhuber},
journal= {arXiv preprint arXiv:1201.0292},
year = {2012}
}