中文

教变强代理通过视觉语言模型作为动作顾问进行提升:面向在线强化学习的 VARL 框架

机器学习 2025-09-26 v1 人工智能

摘要

在复杂任务中进行在线强化学习耗时耗力,因为需要大量与环境的交互步骤来学习最优 Q 函数。视觉语言动作(VLA)策略是解决多样化任务的有前景的方向;然而,其在低层控制任务上的性能仍有限,且有效部署通常需要针对特定任务的专家演示进行微调。在本文中,我们提出了 \textbf{VARL}(\textbf{V}LM 作为 \textbf{A}ction 顾问进行 \textbf{R}einforcement \textbf{L}earning)框架,利用视觉语言模型(VLM)的领域知识为强化学习代理提供动作建议。不同于以往方法,VARL 提供动作建议而非设计启发式奖励,从而保证保持最优性和收敛性。所提议的动作增加了样本的多样性,最终提高了样本效率,尤其在稀疏奖励任务中效果显著。为验证 VARL 的有效性,我们在多样化环境和代理设置下进行评估。结果表明,VARL 在不引入显著计算开销的前提下大幅提高了样本效率。这些优势使 VARL 成为在线强化学习的通用框架,使得可以直接从头开始在真实环境中应用强化学习成为可能。

关键词

引用

@article{arxiv.2509.21126,
  title  = {Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning},
  author = {Xiefeng Wu and Jing Zhao and Shu Zhang and Mingyu Hu},
  journal= {arXiv preprint arXiv:2509.21126},
  year   = {2025}
}