中文

SpeedAug:通过节奏丰富策略和强化学习微调实现策略加速

机器人学 2025-12-02 v1 人工智能 机器学习

摘要

近期在机器人策略学习方面的进展使复杂操作得以在真实环境中实现,但这些策略的执行速度常常滞后于硬件能力,这是由于收集更快演示的成本。现有工作在策略加速方面通过重新解释未知执行速度下的动作序列,从而遇到来自原始演示的分布性偏移。强化学习是一种承诺的方案,可在无需额外演示的情况下为更快的执行适配策略,但其无导向探索在样本效率方面存在挑战。我们提出 SpeedAug,一个基于强化学习的策略加速框架,高效地为更快的任务执行适配预训练策略。SpeedAug 通过在速度增强演示上预训练策略,构建涵盖多种任务执行节奏的行为先验。实验在机器人操作基准测试中表明,从该节奏丰富策略初始化的强化学习微调,显著提高了现有强化学习和策略加速方法的样本效率,同时保持了高成功率。

关键词

引用

@article{arxiv.2512.00062,
  title  = {SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning},
  author = {Taewook Nam and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2512.00062},
  year   = {2025}
}