中文

基于时序行为树引导的不完美演示学习与轨迹修复

机器学习 2026-04-07 v1 人工智能 机器人学 系统与控制 系统与控制

摘要

从演示中学习机器人控制策略是一种强大的范式,但现实世界数据往往是次优的、带噪声的或存在其他不完美情况,这给模仿学习和强化学习带来了重大挑战。本文提出了一个正式框架,利用时序行为树 (TBT) —— 一种将信号时序逻辑 (STL) 扩展为带行为树语义的形式方法 —— 在后续策略学习前修复次优轨迹。给定违反 TBT 规范的演示,基于模型的修复算法纠正轨迹片段以满足形式约束,生成既在逻辑上一致又具可解释性的数据集。修复后的轨迹随后用于提取势函数,以塑造强化学习的奖励信号,引导智能体向与任务一致的状态空间区域移动,无需了解智能体的运动学模型。我们在离散网格世界导航和连续单智能体/多智能体到达-规避任务上展示了该框架的有效性,凸显了在无法获得高质量演示的情景下的数据高效机器人学习潜力。

关键词

引用

@article{arxiv.2604.04225,
  title  = {Learning from Imperfect Demonstrations via Temporal Behavior Tree-Guided Trajectory Repair},
  author = {Aniruddh G. Puranic and Sebastian Schirmer and John S. Baras and Calin Belta},
  journal= {arXiv preprint arXiv:2604.04225},
  year   = {2026}
}

备注

12 pages, 4 figures. This work has been submitted to the IEEE for possible publication