Sat-EnQ:用于可靠且计算高效的强化学习的弱 Q 学习者满足化集成
机器学习
2025-12-30 v1 人工智能
摘要
Deep Q-learning 算法以极不稳定著称,尤其是在训练早期,最大化算子会放大估计误差。受有限理性理论和发育学习的启发,我们提出了 Sat-EnQ,一个两阶段框架,在激进优化之前先学习达到“足够好”。在第一阶段,我们在满足化目标下训练轻量级 Q-network 集成,该目标利用动态基线限制早期价值增长,在避免灾难性高估的同时产生多样、低方差的估计。在第二阶段,该集成被蒸馏为更大的网络,并使用标准 Double DQN 进行微调。我们从理论上证明,满足化诱导有界更新且不会增加目标方差,并推论量化了实现显著降低的条件。实验表明,Sat-EnQ 实现了 3.8 倍的方差降低,消除了灾难性失败(0% 对 DQN 的 50%),在环境噪声下保持 79% 的性能,并且比 bootstrapped 集成少需要 2.5 倍的计算量。我们的结果凸显了一条通过在优化前采用满足化来实现鲁棒强化学习的原则性路径。
关键词
引用
@article{arxiv.2512.22910,
title = {Sat-EnQ: Satisficing Ensembles of Weak Q-Learners for Reliable and Compute-Efficient Reinforcement Learning},
author = {Ünver Çiftçi},
journal= {arXiv preprint arXiv:2512.22910},
year = {2025}
}