何时 ASK:基于不确定性门控的语言辅助强化学习
人工智能
2026-04-03 v1 机器学习
摘要
强化学习(RL)代理常在分布外(OOD)情景中表现不佳,导致高不确定性和随机行为。虽然语言模型(LMs)包含宝贵的世界知识,但更大的模型会带来高计算成本,阻碍实时应用,且在自主规划方面存在局限。我们提出 Adaptive Safety through Knowledge(ASK),将较小的语言模型与训练好的 RL 策略结合,以无需重新训练的方式提升 OOD 泛化能力。ASK 采用蒙特卡罗 Dropout 评估不确定性,仅在不确定性超过设定阈值时查询语言模型获取动作建议。这种选择性使用既保留了现有策略的效率,又利用了语言模型的推理能力在不确定情境下发挥作用。在 FrozenLake 环境中的实验表明,ASK 在内在分布上未实现改进,但在迁移任务中展现出稳健的导航能力,实现奖励为 0.95。我们的发现表明,有效的神经符号集成需要仔细的协调,而非简单组合,强调需要足够的模型规模和有效的混合机制才能实现成功的 OOD 泛化。
引用
@article{arxiv.2604.02226,
title = {When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning},
author = {Juarez Monteiro and Nathan Gavenski and Gianlucca Zuin and Adriano Veloso},
journal= {arXiv preprint arXiv:2604.02226},
year = {2026}
}
备注
In Proceedings of International Joint Conference on Neural Networks (IJCNN)