中文

将强化学习蒸馏至单批次数据集

机器学习 2025-08-14 v1

摘要

数据集蒸馏将大型数据集压缩为小型合成数据集,使得在合成数据集上的学习近似于在原始数据集上的学习。在蒸馏数据集上进行训练最少只需一步梯度下降即可完成。我们通过将强化学习环境蒸馏为单批次监督学习数据集,证明了蒸馏可推广至不同任务。这不仅证明了蒸馏压缩强化学习任务的能力,也证明了其将一种学习模态(强化学习)转换为另一种学习模态(监督学习)的能力。我们提出了一种用于元学习的近端策略优化的新颖扩展,并将其应用于经典 cart-pole 问题的多维扩展、所有 MuJoCo 环境以及几款 Atari 游戏的蒸馏中。我们展示了蒸馏将复杂强化学习环境压缩为单步监督学习的能力,探索了强化学习蒸馏在不同学习器架构间的泛化能力,并展示了将环境蒸馏为最小可能合成数据集的效果。

关键词

引用

@article{arxiv.2508.09283,
  title  = {Distilling Reinforcement Learning into Single-Batch Datasets},
  author = {Connor Wilhelm and Dan Ventura},
  journal= {arXiv preprint arXiv:2508.09283},
  year   = {2025}
}

备注

to be published in ECAI 2025 (appendix in arXiv version only), 11 pages (7 content, 4 appendix), 6 figures