中文

利用时延长动作提升规划与模型基强化学习

机器学习 2025-10-23 v2 人工智能 机器人学

摘要

连续时间系统常被离散时间动力学建模,但这需要小的仿真步长以保持精度。进而需要较大的规划视野,这导致计算密集的规划问题并降低性能。先前的模型无监督强化学习工作通过动作重复部分解决了此问题,学习策略以确定离散动作持续时间。相反,我们提出直接控制连续决策时间尺度的方法,采用时延长动作,并让规划器将动作持续时间视为除标准动作变量外的额外优化变量。这种额外结构具有多个优势。它加速了轨迹的仿真时间,尤其重要的是,它允许在规划器中使用浅层搜索深度,同时对原始动作进行深层时域搜索。此外,在模型基强化学习(MBRL)设置下,它减少了模型学习导致的误差累积,并提高了模型的训练时间。我们表明,这一想法有效且动作持续时间的取值范围可通过多臂老虎机方案自动选择并集成到 MBRL 框架中。广泛的实验评估表明,我们的方法在规划和 MBRL 中均实现更快的规划、更好的解决方案,且能够解决标准公式中无法解决的问题。

关键词

引用

@article{arxiv.2505.15754,
  title  = {Improving planning and MBRL with temporally-extended actions},
  author = {Palash Chatterjee and Roni Khardon},
  journal= {arXiv preprint arXiv:2505.15754},
  year   = {2025}
}

备注

NeurIPS 2025. For project website, see https://pecey.github.io/MBRL-with-TEA/