中文

受约束 Q 学习

机器人学 2025-12-02 v2

摘要

现实机器人任务往往需要智能体在满足时变安全约束的同时实现目标序列。然而,标准强化学习(RL)范式在此类环境中受限。将 RL 与线性时序逻辑(LTL)组合的自然方法是解决这一问题的途径——LTL 用于指定复杂且时延扩展的任务与安全约束。然而,现有针对 LTL 目标的 RL 方法在复杂连续环境中表现不佳,缺乏支撑同时实现时序有序目标与安全约束的可扩展方法,难以适用于真实机器人场景。我们提出受约束 Q 学习(ACQL),一种算法通过目标条件化价值学习与自动机引导的强化学习相结合来填补这一空白。ACQL 支持大多数 LTL 任务规范,利用其自动机表示显式编码阶段性目标进度以及 stationary 与 non-stationary 安全约束。我们展示,ACQL 在一系列连续控制任务中超越现有方法,包括先前方法难以满足目标到达或安全约束的情形。我们进一步通过在带安全约束的杂乱类柜-like 空间中执行目标到达任务,将其实际应用于 6 自由度机器人臂。结果表明,ACQL 是一种稳健且可扩展的解决方案,可根据丰富时序规范学习机器人行为。

关键词

引用

@article{arxiv.2510.05061,
  title  = {Automaton Constrained Q-Learning},
  author = {Anastasios Manganaris and Vittorio Giammarino and Ahmed H. Qureshi},
  journal= {arXiv preprint arXiv:2510.05061},
  year   = {2025}
}

备注

10 main content pages, 4 main content figures, 11 appendix pages, 5 appendix figures, camera ready version submitted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)