基于动态子目标与贝叶斯优化的探索方法
最优化与控制
2023-10-13 v5 机器学习
摘要
在奖励稀疏的导航环境中,交互代价高且有限,强化学习具有挑战性,并且需要对有效探索的需求。受需要真实世界训练(当廉价模拟器不可用时)的复杂导航任务驱动,我们考虑一个面对未知环境分布并必须决定探索策略的智能体。它可利用一系列训练环境来改进其策略,之后在同环境分布抽取的测试环境中被评估。大多数现有方法关注固定探索策略,而少数将探索视为元优化问题的方法往往忽略对代价高效探索的需求。我们提出一种代价感知的贝叶斯优化方法,能高效搜索一类基于动态子目标的探索策略。该算法调节多种杠杆——子目标的位置、每轮的长度、以及每次试验的重复次数——以克服稀疏奖励、昂贵交互和噪声的挑战。实验评估表明,新方法在多个问题域上优于现有基线。我们还提供了理论基础,并证明该方法渐近地识别近优子目标设计。
引用
@article{arxiv.1910.09143,
title = {Dynamic Subgoal-based Exploration via Bayesian Optimization},
author = {Yijia Wang and Matthias Poloczek and Daniel R. Jiang},
journal= {arXiv preprint arXiv:1910.09143},
year = {2023}
}