Eau De $Q$-Network: 深度强化学习中神经网络的自适应蒸馏
机器学习
2025-06-23 v2 人工智能
摘要
近期研究已成功证明稀疏深度强化学习智能体可以与其密集对应物竞争。这为推理时间和内存需求受成本敏感或硬件限制领域的强化学习应用开辟了机会。此前,密集到稀疏方法依赖于与智能体学习节奏不同步的手设计稀疏度调度。关键的是,最终稀疏度被选为超参数,需要仔细调优,因为设置过高可能导致性能下降。在本工作中,我们通过设计一种密集到稀疏算法来解决这些不足,我们将其命名为Eau De -Network(EauDeQN)。为了以智能体的学习节奏增加稀疏度,我们考虑具有不同稀疏度的多个在线网络,每个在线网络从共享的目标网络训练。在每次目标更新时,损失最小的在线网络被选为下一个目标网络,而其他网络被替换为所选网络的剪枝版本。我们在Atari 基准和MuJoCo物理模拟器上评估了所提方法,结果表明EauDeQN在保持高性能的同时达到了高稀疏度水平。
引用
@article{arxiv.2503.01437,
title = {Eau De $Q$-Network: Adaptive Distillation of Neural Networks in Deep Reinforcement Learning},
author = {Théo Vincent and Tim Faust and Yogesh Tripathi and Jan Peters and Carlo D'Eramo},
journal= {arXiv preprint arXiv:2503.01437},
year = {2025}
}
备注
Published at RLC 2025: https://openreview.net/forum?id=Bb84iBj4wU#discussion