超越 Noisy-TVs:基于学习进度监控的噪声鲁棒探索
机器学习
2026-04-06 v2 人工智能
摘要
当环境中存在不可学习的随机源(noisy-TV)时,基于朴素内在奖励驱动的探索智能体会卡在该随机源处并导致探索失败。基于不确定性估计或分布相似性的内在奖励虽然随时间推移最终能逃离 noisy-TVs,但存在样本效率低和计算成本高的问题。受神经科学中关于人类在探索过程中监控自身进步的近期发现启发,我们提出了一种新的内在动机探索方法,称为学习进度监控 (LPM)。在探索过程中,LPM 奖励模型的改进而非预测误差或新颖性,有效地奖励智能体观察可学习的状态转移而非不可学习的状态转移。我们引入了一种双网络设计,使用误差模型预测动力学模型在上一迭代的预期预测误差,并利用当前迭代与上一迭代的模型误差之差来指导探索。我们从理论上证明,LPM 的内在奖励是零等变的,且是信息增益 (IG) 的单调指标,同时误差模型对于实现与 IG 的单调性对应是必要的。我们在基于 MNIST、具有 160x120 RGB 输入的 3D 迷宫和 Atari 的噪声环境中,将 LPM 与 SOTA 基线进行了实验比较。结果表明,LPM 的内在奖励收敛更快,在迷宫实验中探索了更多状态,并在 Atari 中获得了更高的外在奖励。这种概念上简单的方法标志着噪声鲁棒探索的范式转变。复现实验的代码见 https://github.com/Akuna23Matata/LPM_exploration
引用
@article{arxiv.2509.25438,
title = {Beyond Noisy-TVs: Noise-Robust Exploration Via Learning Progress Monitoring},
author = {Zhibo Hou and Zhiyu An and Wan Du},
journal= {arXiv preprint arXiv:2509.25438},
year = {2026}
}
备注
Accepted for ICLR 2026