可度量的蒙特卡洛搜索误差界
人工智能
2021-11-04 v2 数值分析
数值分析
摘要
蒙特卡洛规划器常常返回次优动作,即便它们被保证在无限样本极限下收敛。已知的渐近后悔界无法在搜索结束时提供所推荐动作的置信度度量方式。本工作中,我们证明了针对非平稳多臂_bandit 和马尔可夫决策过程的蒙特卡洛估计次优性界。这些界可在搜索结束时直接计算,且不需要真实动作值的知识。所提界适用于满足温和收敛条件的一般蒙特卡洛求解器。我们通过多臂_bandit 和离散马尔可夫决策过程上的实验,对一个简单求解器和蒙特卡洛树搜索测试了界的紧性。
引用
@article{arxiv.2106.04715,
title = {Measurable Monte Carlo Search Error Bounds},
author = {John Mern and Mykel J. Kochenderfer},
journal= {arXiv preprint arXiv:2106.04715},
year = {2021}
}
备注
9 pages, submitted to ALT 2022