基石模型下的探索:能力、局限性与混合方法
机器学习
2025-09-25 v1 人工智能
摘要
在稀疏奖励环境中,强化学习(RL)的探索问题仍然具有挑战性。尽管基石模型拥有强大的语义先验,但其作为零样本探索代理在经典RL基准测试中的能力尚不明了。我们对LLMs和VLMs在多臂老虎机、Gridworld以及稀疏奖励Atari环境中进行零样本探索基准测试。我们的调查结果表明,一个关键局限性是:尽管VLMs能够从视觉输入推断高层目标,但在精确的低层控制方面始终失败——存在“知道做错”的鸿沟。为分析这一鸿沟的潜在桥梁,我们在受控、最佳情景下检验一种简单的在策略混合框架。我们在这个理想化的设置中发现,VLM指导能够显著提高早期阶段的样本效率,从而对使用基石模型指导探索而非用于端到端控制的潜力与约束提供了清晰的分析。
引用
@article{arxiv.2509.19924,
title = {Exploration with Foundation Models: Capabilities, Limitations, and Hybrid Approaches},
author = {Remo Sasso and Michelangelo Conserva and Dominik Jeurissen and Paulo Rauber},
journal= {arXiv preprint arXiv:2509.19924},
year = {2025}
}
备注
16 pages, 7 figures. Accepted for presentation at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on the Foundations of Reasoning in Language Models (FoRLM)