深度内在惊奇正则化控制(DISRC):一种用于稀疏环境中高效深度Q学习的生物启发机制
摘要
深度强化学习(DRL)推动了自主控制的重大进步。然而,标准的深度Q网络(DQN)智能体倾向于依赖固定的学习率和统一的更新缩放,即使更新受到时序差分(TD)误差的调节。这种刚性破坏了收敛的稳定性,尤其是在反馈不频繁的稀疏奖励设置中。我们引入了深度内在惊奇正则化控制(DISRC),这是一种受生物启发的对深度Q网络的增强,它基于潜在空间惊奇动态缩放Q更新。DISRC通过基于层归一化(LayerNorm)的编码器对状态进行编码,并计算相对于移动潜在设定点的基于偏差的惊奇分数。然后,每个更新按比例缩放,比例与时序差分误差和惊奇强度都相关,从而在早期探索中促进可塑性,并在熟悉度增加时促进稳定性。我们在两个稀疏奖励的MiniGrid环境(包括MiniGrid-DoorKey-8x8和MiniGrid-LavaCrossingS9N1)上,在与普通深度Q网络基线相同的设置下评估了DISRC。在DoorKey中,DISRC达到第一个成功回合(奖励 > 0.8)的速度比普通深度Q网络基线快33%(79回合 vs. 118回合),具有更低的奖励标准差(0.25 vs. 0.34)和更高的奖励曲线下面积(AUC:596.42 vs. 534.90)。这些指标反映了更快、更一致的学习——这对于稀疏、延迟奖励的设置至关重要。在LavaCrossing中,DISRC获得了更高的最终奖励(0.95 vs. 0.93)和所有智能体中最高的曲线下面积(957.04),尽管它收敛得更渐进。这些初步结果确立了DISRC作为一种调节离策略智能体学习强度的新颖机制,提高了稀疏奖励领域的效率和稳定性。通过将惊奇视为一种内在学习信号,DISRC使智能体能够基于期望违背来调节更新,从而在传统基于价值的方法不足时提高决策质量。
引用
@article{arxiv.2601.17598,
title = {Deep Intrinsic Surprise-Regularized Control (DISRC): A Biologically Inspired Mechanism for Efficient Deep Q-Learning in Sparse Environments},
author = {Yash Kini and Shiv Davay and Shreya Polavarapu},
journal= {arXiv preprint arXiv:2601.17598},
year = {2026}
}
备注
5 pages, 3 figures, 1 table. Preprint version of work submitted, accepted, and presented at IEEE URTC. Accepted and pending publication in IEEE Xplore