中文

蒸馏策略集合如何提高强化学习中的泛化

机器学习 2025-10-24 v2 人工智能

摘要

在强化学习中的零样本策略迁移场景中,目标是训练一个在固定的训练环境中训练的智能体,以便在类似但未见的测试环境中进行泛化。先前的工作表明,训练后进行策略蒸馏有时会产生在测试环境中超越原始策略的策略。然而,尚不清楚为何如此,或应使用什么数据进行蒸馏。本文在特定假设下,对训练后进行策略蒸馏提出一个通用的泛化界限。该理论提供了两个实用见解:为 improved 泛化,您应该 1) 训练一个蒸馏策略的集合,以及 2) 使用尽可能多的训练环境数据进行蒸馏。我们经验性地验证了这些见解在更一般的设置中是否成立,即即便在先前假设不再成立时亦然。最后,我们展示了一个在多样化数据集上蒸馏的策略集合能够显著优于原始智能体的泛化能力。

关键词

引用

@article{arxiv.2505.16581,
  title  = {How Ensembles of Distilled Policies Improve Generalisation in Reinforcement Learning},
  author = {Max Weltevrede and Moritz A. Zanger and Matthijs T. J. Spaan and Wendelin Böhmer},
  journal= {arXiv preprint arXiv:2505.16581},
  year   = {2025}
}