中文

基于随机网络蒸馏的反探索

机器学习 2023-05-18 v2 人工智能 神经与进化计算

摘要

尽管随机网络蒸馏(RND)在多个领域取得了成功,但已有研究表明其区分度不足以作为离线强化学习中惩罚分布外动作的不确定性估计器。在本文中,我们重新审视这些结果,并指出若对 RND 先验采用朴素的调节条件选择,智能体将难以有效最小化反探索奖励,且区分度本身并非问题所在。我们表明,基于特征线性调制(FiLM)的调节条件可避免这一局限,从而得到一个基于 Soft Actor-Critic 的简洁高效、无需集成体的算法。我们在 D4RL 基准上对其进行评估,结果表明其性能可与基于集成的方法相媲美,并大幅优于无集成方法。

关键词

引用

@article{arxiv.2301.13616,
  title  = {Anti-Exploration by Random Network Distillation},
  author = {Alexander Nikulin and Vladislav Kurenkov and Denis Tarasov and Sergey Kolesnikov},
  journal= {arXiv preprint arXiv:2301.13616},
  year   = {2023}
}

备注

ICML 2023, Poster, Source code: https://github.com/tinkoff-ai/sac-rnd