中文

TAIL-Safe:针对模仿学习策略的任务无关安全监控

机器人学 2026-05-11 v2

摘要

近期模仿学习(IL)算法,如流匹配和扩散策略,展现出学习复杂操控任务的卓越性能。然而,这些策略常即使在运行时处于其训练分布内,也会因对初始条件极其敏感且不可消除的近似误差导致失败,这会导致误差叠加。这使得在实际部署时因分布外情景而不安全。安全部署的前提是使策略能够判断自己是否能够按所学方式完成任务。本文提出 TAIL-Safe,一种原则化的方法,用于识别训练好的 IL 策略能够完成所学任务的安全区域。我们提出一种 Lipschitz 连续的 Q 值函数,将状态-动作对映射到基于三项短期任务无关准则:可见性、可识别性和可抓取性的长期安全评分。该函数的零超子集刻画了状态-动作对的经验控制不变集。当名义策略提出位于该集合之外的动作时,我们应用受Nagumo定理启发的恢复机制,使用梯度上升至 Q 函数,以将策略引导回安全区域。为学习该 Q 函数,我们构建了使用高保真数字孪生体(基于 Gaussian Splatting)的系统,以无风险收集故障数据。Franka Emika 机器人实验表明,面临运行时扰动会失败的流匹配策略,经TAIL-Safe 指导后可实现一致的任务成功。

关键词

引用

@article{arxiv.2605.01195,
  title  = {TAIL-Safe: Task-Agnostic Safety Monitoring for Imitation Learning Policies},
  author = {Riad Ahmed and Momotaz Begum},
  journal= {arXiv preprint arXiv:2605.01195},
  year   = {2026}
}