利用执行者-学习者蒸馏在强化学习中实现高效Transformer
机器学习
2021-04-06 v1
摘要
许多现实应用(如机器人技术)对功耗和计算能力施加了硬性约束,限制了强化学习(RL)智能体可行模型的复杂度。类似地,在许多分布式RL设置中,执行动作是在CPU等无加速硬件上完成的,这同样限制了模型规模以防止实验运行时间难以承受。这些“执行者延迟”受限的设置对近期在监督学习中极为成功的模型复杂度扩展构成了主要障碍。为了能够在利用大模型容量的同时仍满足执行期间系统所施加的限制,我们开发了一种“执行者-学习者蒸馏”(ALD)过程,其利用一种持续形式的蒸馏,将学习进度从大容量学习者模型迁移到小容量执行者模型。作为一个案例研究,我们在部分可观测环境的背景下开发该过程,其中Transformer模型近期相较LSTM取得了大幅改进,但代价是计算复杂度显著更高。以Transformer模型作为学习者、LSTM作为执行者,我们在多个具有挑战性的记忆环境中证明,使用执行者-学习者蒸馏恢复了Transformer学习者模型明显的样本效率增益,同时保持了LSTM执行者模型的快速推理与减少的总训练时间。
引用
@article{arxiv.2104.01655,
title = {Efficient Transformers in Reinforcement Learning using Actor-Learner Distillation},
author = {Emilio Parisotto and Ruslan Salakhutdinov},
journal= {arXiv preprint arXiv:2104.01655},
year = {2021}
}
备注
Published at ICLR 2021