中文

任务欠规范对深度强化学习评估的影响

机器学习 2022-10-18 v1 人工智能 机器人学 系统与控制 系统与控制

摘要

深度强化学习(DRL)方法的评估是该领域科学进展的组成部分。除了为通用智能设计 DRL 方法外,针对特定任务设计方法在现实应用中正变得日益突出。在这些场景中,标准评估实践涉及使用少数马尔可夫决策过程(MDP)实例来表征该任务。然而,许多任务由于底层环境的变化(尤其在现实情境中)会引出庞大的 MDP 族。例如,在交通信号控制中,变化可能源于交叉口几何结构与交通流量水平。因此,所选的 MDP 实例可能无意中导致过拟合,缺乏统计功效来就该方法在整个族上的真实性能得出结论。在本文中,我们扩展 DRL 评估以考虑参数化的 MDP 族。我们表明,与在选定 MDP 实例上评估 DRL 方法相比,对 MDP 族进行评估常常给出显著不同的方法相对排序,令人怀疑哪些方法应被视为最先进的(state-of-the-art)。我们在标准控制基准与交通信号控制这一现实应用中验证了该现象。同时,我们表明在 MDP 族上准确评估并非易事。总体而言,本工作指出了强化学习在经验严谨性方面的新挑战,尤其是当 DRL 的结果渗入下游决策时。

关键词

引用

@article{arxiv.2210.08607,
  title  = {The Impact of Task Underspecification in Evaluating Deep Reinforcement Learning},
  author = {Vindula Jayawardana and Catherine Tang and Sirui Li and Dajiang Suo and Cathy Wu},
  journal= {arXiv preprint arXiv:2210.08607},
  year   = {2022}
}

备注

Accepted for publication at NeurIPS 2022