达成目标并非易事:随机最短路径的样本复杂度定论
机器学习
2022-10-12 v1 人工智能
机器学习
摘要
我们研究在随机最短路径(SSP)问题中学习 -最优策略的样本复杂度。我们首先推导了学习者可访问生成模型时的样本复杂度界限。我们证明存在一个最坏情况下的 SSP 实例,具有 个状态、 个动作、最小代价 以及所有状态上最优策略的最大期望代价 ,其中任何算法都需要至少 个样本才能以高概率返回 -最优策略。令人惊讶的是,这意味着每当 时,SSP 问题可能是不可学习的,从而揭示了 SSP 中的学习严格难于有限时域和折扣设置中的学习。我们补充了当具有最优策略命中时间的先验知识以及当通过与具有有界命中时间的策略竞争来限制最优性时的下界。最后,我们设计了一种在这些情况下具有匹配上界的算法。这解决了使用生成模型在 SSP 中学习 -最优策略的样本复杂度问题。我们还发起了在不访问生成模型的情况下学习 -最优策略(即所谓的最佳策略识别问题)的研究,并证明一般情况下无法进行样本高效的学习。另一方面,如果我们假设智能体可以通过支付固定代价从任何状态直接到达目标状态,则可以实现高效学习。然后,我们在该假设下建立了首个上界和下界。最后,使用类似的分析工具,我们证明在一般代价下 SSP 中不可能实现无时域遗憾,解决了 (Tarbouriech et al., 2021c) 中的一个开放问题。
引用
@article{arxiv.2210.04946,
title = {Reaching Goals is Hard: Settling the Sample Complexity of the Stochastic Shortest Path},
author = {Liyu Chen and Andrea Tirinzoni and Matteo Pirotta and Alessandro Lazaric},
journal= {arXiv preprint arXiv:2210.04946},
year = {2022}
}