技能何时能帮助强化学习?关于时序抽象的理论分析
机器学习
2024-06-13 v1 人工智能
摘要
技能是旨在通过层次化强化学习提高强化学习(RL)性能的时序抽象。尽管我们对环境使技能有用特性有所直觉,但缺乏精确的表征。我们提供了首个这样的表征,聚焦于确定性技能在确定性稀疏奖励环境中有限动作空间的实用性。我们在理论和实证方面表明,当解状态的可压缩性较差时,技能对RL性能的提升效果较差。额外的理论结果表明,技能对探索的帮助大于对从现有经验中学习的帮助,并且使用不够表征的技能如宏动作可能会恶化RL性能。我们希望我们的发现能指导自动技能发现研究,并帮助RL实践者更好地决定何时以及如何使用技能。
引用
@article{arxiv.2406.07897,
title = {When Do Skills Help Reinforcement Learning? A Theoretical Analysis of Temporal Abstractions},
author = {Zhening Li and Gabriel Poesia and Armando Solar-Lezama},
journal= {arXiv preprint arXiv:2406.07897},
year = {2024}
}
备注
29 pages, 1 figure. Accepted to ICML 2024