基于策略改进准则的神经到树策略蒸馏
机器学习
2021-08-17 v1
摘要
尽管深度强化学习在具有挑战性的决策任务中取得了有前景的结果,但其成功的主要支柱——深度神经网络大多是黑盒。深入了解黑盒模型的一种可行方法是将其蒸馏为一个可解释模型,例如由 if-then 规则组成、易于理解和验证的决策树。然而,传统的模型蒸馏通常是在平稳数据分布假设下的监督学习任务,而这一假设在强化学习中不成立。因此,典型的策略蒸馏即便以微小误差克隆模型行为,也可能带来数据分布偏移,导致得到的蒸馏策略模型保真度低或性能差。本文中,我们提出通过将蒸馏目标从行为克隆改为最大化优势评估来解决此问题。这一新颖的蒸馏目标最大化近似累积奖励,并更关注关键状态中的灾难性行为,从而控制数据偏移效应。我们在多个 Gym 任务、一款商业格斗游戏和一个自动驾驶汽车模拟器上评估了我们的方法。实证结果表明,所提方法比行为克隆能保持更高的累积奖励,并学到与原始策略更一致的策略。此外,通过检查从蒸馏决策树中提取的规则,我们证明了所提方法给出了合理且鲁棒的决策。
引用
@article{arxiv.2108.06898,
title = {Neural-to-Tree Policy Distillation with Policy Improvement Criterion},
author = {Zhao-Hua Li and Yang Yu and Yingfeng Chen and Ke Chen and Zhipeng Hu and Changjie Fan},
journal= {arXiv preprint arXiv:2108.06898},
year = {2021}
}