中文

SPAARS:通过抽象探索与行动空间精细开发实现更安全的强化学习策略对齐

机器学习 2026-03-12 v2 人工智能 机器人学

摘要

离线到在线强化学习 (RL) 为机器人提供了以安全的离线演示为基础进行预训练,再通过在线交互进行微调的前景景象。然而,一个根本性挑战仍然存在:如何在不偏离离线数据行为支持的前提下进行安全的在线探索?虽然最近的方法利用条件变分自编码器 (CVAE) 在潜在空间内限制探索,但本质上存在一种开发 gap——由解码器的重构损失施加的性能上限。我们引入 SPAARS,一个课程学习框架,最初将探索约束在低维潜在流形上以实现样本高效、安全的行为改进,然后无缝将控制转移到原始行动空间,规避解码器瓶颈。SPAARS 有两种实现方式:基于 CVAE 的变体仅需无序 (s,a) 配对且无需轨迹分段;SPAARS-SUPE 将 SPAARS 与 OPAL 时间技能预训练相结合,以在更强的探索结构方面获益,代价是需要轨迹块。我们利用性能差异引理 (Performance Difference Lemma) 证明了开发 gap 的上界,证明了潜在空间策略梯度相对于原始空间探索在方差上实现可证明的降低,并展示了在潜在阶段进行同步行为克隆直接控制课程过渡的稳定性。经验上,SPAARS-SUPE 在 kitchen-mixed-v0 上的归一化回报为 0.825,相较于 SUPE 的 0.75,样本效率提升 5 倍;独立运行的 SPAARS 在 hopper-medium-v2 和 walker2d-medium-v2 上的归一化回报分别为 92.7 和 102.9,分别超过 IQL 基线的 66.3 和 78.3,确认了无序配对 CVAE 实现方式的实用性。

关键词

引用

@article{arxiv.2603.09378,
  title  = {SPAARS: Safer RL Policy Alignment through Abstract Exploration and Refined Exploitation of Action Space},
  author = {Swaminathan S K and Aritra Hazra},
  journal= {arXiv preprint arXiv:2603.09378},
  year   = {2026}
}

备注

9 pages