基于 PAC-Bayes 的深度探索
机器学习
2025-08-21 v5
摘要
在延迟奖励的连续控制场景下,强化学习 (RL) 仍是一个值得广泛关注的难题,尽管在实际应用中意义重大。许多复杂技能都以中间技能为先决条件。例如,人oid 机器人在能够行走之前必须首先学习站立。为了应对延迟奖励,智能体必须进行深度探索。然而,现有的深度探索方法是为小型离散动作空间设计的,其对先进的连续控制的泛化尚未得到证明。本文首次从 PAC-Bayes 视角着手解决深度探索问题,具体是在演员-评论家学习框架中实现。为此,我们通过 PAC-Bayes 边界对 Bellman 算子进行误差量化,其中由引导式小样本集代表后验分布,其目标作为数据驱动的函数空间先验。我们从该边界推导目标函数,并用于训练评论家小样本集。每个评论家都训练一个独立的软演员网络,该网络由共享的主干和评论家特定的头部实现。该智能体通过对随机选择的演员头部进行 epsilon-软行为来进行深度探索。我们提出的算法称为 PAC-Bayesian 演员-评论家 (PBAC),是唯一在难度各异的连续控制任务中持续发现延迟奖励的算法。
引用
@article{arxiv.2402.03055,
title = {Deep Exploration with PAC-Bayes},
author = {Bahareh Tasdighi and Manuel Haussmann and Nicklas Werge and Yi-Shan Wu and Melih Kandemir},
journal= {arXiv preprint arXiv:2402.03055},
year = {2025}
}
备注
ECAI camera-ready version; fixed acknowledgements; fixed github reference