中文

行为蒸馏

机器学习 2024-06-24 v1 人工智能

摘要

数据蒸馏旨在将大型数据集浓缩为少量合成示例,用于在训练新模型时作为即插即用替换品。其应用包括可解释性、神经网络架构搜索、隐私和持续学习。尽管在监督领域取得了显著成功,但此类方法尚未扩展到强化学习领域,因为缺乏固定数据集,使大多数蒸馏方法难以使用。填补这一空白,我们形式化了行为蒸馏,即发现并浓缩训练专家策略所需信息的过程,生成状态-动作对的合成数据集,而无需访问专家数据。我们随后引入了基于演化策略的幻觉数据集 (Hallucinating Datasets with Evolution Strategies, HaDES),一种可进行行为蒸馏的方法,仅需四个状态-动作对的合成数据集,即可在连续控制任务中训练代理,达到与专家相当的性能水平。我们展示了这些数据集在训练具有广泛架构和超参数的策略时具有良好的外推能力。我们还演示了将其应用于下游任务的能力,即以零样本方式训练多任务代理。除了行为蒸馏之外,HaDES 对于强化学习中的神经进化也提供了显著的改进,并在一项标准的监督数据蒸馏任务中实现了最先进 (SOTA) 结果。最后,我们表明,可视化合成数据集可提供人类可解释的任务洞察。

关键词

引用

@article{arxiv.2406.15042,
  title  = {Behaviour Distillation},
  author = {Andrei Lupu and Chris Lu and Jarek Liesen and Robert Tjarko Lange and Jakob Foerster},
  journal= {arXiv preprint arXiv:2406.15042},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024