何时(以及如何)信任专家:诊断查询式专家引导强化学习
人工智能
2026-05-12 v1
摘要
许多连续控制问题附带一个专业但次优的控制器(调谐的PID、手工设计的步态)。日益增长的一系列方法在RL期间将此类控制器用作可查询的专家,但每种方法都在不同基准上以孤立的方式提出,缺乏对不完美专家的测试。我们在共享的SAC主干、统一的超参数优化和评估协议、每个(环境、方法)配100/50个随机种子,以及对专家过度调谐、动作偏差和观测噪声的退化扫描下,对方法进行了统一比较。比较揭示了单篇论文评估遗漏的三个失败模式:(F1)在argmax-plus-bootstrap下,评估者对专家接近无专家RL天花板(RL-接近天花板)时产生盲区,将IBRL压制在无专家SAC之下(与绝对物理天花板不同);(F2)在远离最优专家处的残余饱和;(F3)在部署时专家过度调谐下,训练时handoff方法受到缓冲区 poisoning 的影响而崩溃。没有单一方法占据优势:每种方法在一种任务结构下均获胜,而在其他情况下则可预测地失败;在FourTank、GlassFurnace等RL-接近天花板专家上,没有查询式方法能在1M步预算内超过专家,这留下了一个问题:这是否是根本性障碍,还是预算效应。我们将这种差异转化为基于三个预训练观测量(专家质量、任务终止、扰动类型)的可测试决策规则。本文的首要贡献是基准、分类学和决策规则;我们另外描述了EDGE,这是一种softmax-over-ensemble-LCB设计点,用于演示分类学所指向的两个轴(门控形式、评分规则)各自都可以被利用。
引用
@article{arxiv.2605.09109,
title = {When (and How) to Trust the Expert: Diagnosing Query-Time Expert-Guided Reinforcement Learning},
author = {Yann Berthelot and Philippe Preux and Riad Akrour},
journal= {arXiv preprint arXiv:2605.09109},
year = {2026}
}