中文

STO-RL:基于 LLM 指导的子目标时间顺序进行稀疏奖励下的离线强化学习

机器学习 2026-01-14 v1 人工智能 系统与控制 系统与控制

摘要

离线强化学习 (RL) 使 policy 能从预收集的数据集中学习,避免高昂且有风险的在线交互,但在涉及稀疏奖励的长期任务时常常难以驾驭。现有的目标条件和层次化离线 RL 方法通过分解任务并生成中间奖励来缓解传统离线 RL 的局限性,但通常忽视子目标之间的时间依赖性,依赖不精确的奖励塑造,导致次优策略。为此,我们提出STO-RL (Offline RL using LLM-Guided Subgoal Temporal Order),一种利用大语言模型 (LLM) 生成时序有序子目标序列及其 state-to-subgoal-stage 映射的离线 RL 框架。借助这种时间结构,STO-RL 应用基于潜能的奖励塑造,将稀疏终端奖励转化为稠密且时序一致的信号,促进子目标进程的同时避免次优解。得到的增强数据集带有塑形奖励,可高效训练出高性能的 policy。在四个离散和连续稀疏奖励基准测试上评估表明,STO-RL 在与 state-of-the-art 离线目标条件和层次化 RL 基线相比,实现了更快的收敛、更高的成功率和更短的轨迹。消融研究进一步表明,STO-RL 对不完美或噪声 LLM 生成的子目标序列具有鲁棒性,证明了 LLM 指导的子目标时序结构结合理论依据的奖励塑造为解决长期离线 RL 提供了实用且可扩展的方案。

关键词

引用

@article{arxiv.2601.08107,
  title  = {STO-RL: Offline RL under Sparse Rewards via LLM-Guided Subgoal Temporal Order},
  author = {Chengyang Gu and Yuxin Pan and Hui Xiong and Yize Chen},
  journal= {arXiv preprint arXiv:2601.08107},
  year   = {2026}
}

备注

Accepted at International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)