中文

分位数过滤模仿学习

机器学习 2021-12-03 v1 机器学习

摘要

我们提出分位数过滤模仿学习(QFIL),一种为离线强化学习设计的新型策略改进算子。QFIL通过对离线数据集的过滤版本运行模仿学习来执行策略改进。该过滤过程移除了估计Q值低于由行为策略采样动作所诱导的值的推前分布给定分位数的s,as,a对。推前Q分布与所得值函数分位数的定义是我们方法的关键贡献。我们证明QFIL在具有函数逼近时给出了安全的策略改进步骤,并且分位数的选择提供了一个自然的超参数来权衡改进步骤的偏差与方差。在实验上,我们进行了一个合成实验来说明QFIL如何有效地做出偏差-方差权衡,并且我们看到QFIL在D4RL基准上表现良好。

关键词

引用

@article{arxiv.2112.00950,
  title  = {Quantile Filtered Imitation Learning},
  author = {David Brandfonbrener and William F. Whitney and Rajesh Ranganath and Joan Bruna},
  journal= {arXiv preprint arXiv:2112.00950},
  year   = {2021}
}

备注

Offline Reinforcement Learning Workshop at Neural Information Processing Systems, 2021