中文

何时 ASK:基于不确定性门控的语言辅助强化学习

人工智能 2026-04-03 v1 机器学习

摘要

强化学习(RL)代理常在分布外(OOD)情景中表现不佳,导致高不确定性和随机行为。虽然语言模型(LMs)包含宝贵的世界知识,但更大的模型会带来高计算成本,阻碍实时应用,且在自主规划方面存在局限。我们提出 Adaptive Safety through Knowledge(ASK),将较小的语言模型与训练好的 RL 策略结合,以无需重新训练的方式提升 OOD 泛化能力。ASK 采用蒙特卡罗 Dropout 评估不确定性,仅在不确定性超过设定阈值时查询语言模型获取动作建议。这种选择性使用既保留了现有策略的效率,又利用了语言模型的推理能力在不确定情境下发挥作用。在 FrozenLake 环境中的实验表明,ASK 在内在分布上未实现改进,但在迁移任务中展现出稳健的导航能力,实现奖励为 0.95。我们的发现表明,有效的神经符号集成需要仔细的协调,而非简单组合,强调需要足够的模型规模和有效的混合机制才能实现成功的 OOD 泛化。

关键词

引用

@article{arxiv.2604.02226,
  title  = {When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning},
  author = {Juarez Monteiro and Nathan Gavenski and Gianlucca Zuin and Adriano Veloso},
  journal= {arXiv preprint arXiv:2604.02226},
  year   = {2026}
}

备注

In Proceedings of International Joint Conference on Neural Networks (IJCNN)