中文

面向稳健机器人控制的离线到在线强化学习中的对抗微调

机器人学 2026-03-02 v2 人工智能

摘要

离线强化学习 enables 在无风险在线交互的情况下获取样本高效的策略,但基于静态数据训练的策略在动作空间扰动(如执行器故障)下仍然脆弱。本研究引入了一个离线到在线框架,该框架在干净数据上训练策略,然后进行对抗微调,其中将扰动注入到执行的动作中,以诱发补偿行为并提高韧性。进一步地,一种以绩效为导向的课程进一步通过指数移动平均信号调整训练期间的扰动概率,平衡韧性和稳定性。针对连续控制 locomotion 任务的实验表明,所提出的方法在离线方法上的韧性显著提高,并且收敛速度快于从头训练。匹配微调和评估条件可实现对动作空间扰动的最强韧性,而自适应课程策略可缓解线性课程策略在名义性能方面的降低。总体而言,结果表明,对抗微调实现了在不确定环境下的自适应和稳健控制,弥合了离线效率与在线可适应性之间的鸿沟。

关键词

引用

@article{arxiv.2510.13358,
  title  = {Adversarial Fine-tuning in Offline-to-Online Reinforcement Learning for Robust Robot Control},
  author = {Shingo Ayabe and Hiroshi Kera and Kazuhiko Kawamoto},
  journal= {arXiv preprint arXiv:2510.13358},
  year   = {2026}
}

备注

15 main pages, 8 supplementary material pages