中文

SOLAR-RL:半在线长期分配强化学习

机器学习 2026-04-27 v1 人工智能

摘要

随着多模态大语言模型(MLLM)的成熟,GUI 代理人正从静态交互演变为复杂导航。虽然强化学习(RL)已成为训练 MLLM 代理人处理动态 GUI 任务的有前景的范例,但其有效应用面临困境。标准的离线 RL 通常依赖于静态的步骤级数据,忽略全局轨迹语义,如任务完成和执行质量。相反,线上 RL 捕捉长期动态,但 suffered from 高交互成本和潜在的环境不稳定性。为弥合这一差距,我们提出了 SOLAR-RL(半在线长期分配强化学习)。我们不仅依赖昂贵的在线交互,本框架将全局轨迹见解直接整合到离线学习过程中。具体而言,我们从静态数据中重构多样化的 rollout 候选方案,使用每一步有效信号检测第一个失败点,并对密集的步骤级奖励进行后向分配,以反映轨迹级别的执行质量,有效地在无需交互成本的情况下模拟在线反馈。广泛的实验表明,SOLAR-RL 在与强大基线相比下显著提高了长期任务完成率和鲁棒性,为自主 GUI 导航提供了一个高效的解决方案。

关键词

引用

@article{arxiv.2604.22558,
  title  = {SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning},
  author = {Jichao Wang and Liuyang Bian and Yufeng Zhou and Han Xiao and Yue Pan and Guozhi Wang and Hao Wang and Zhaoxiong Wang and Yafei Wen and Xiaoxin Chen and Shuai Ren and Lingfang Zeng},
  journal= {arXiv preprint arXiv:2604.22558},
  year   = {2026}
}

备注

14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026