中文

GiB(Good in Bad):通过筛选终端用户演示学习更好的策略

机器人学 2026-05-12 v2

摘要

模仿学习提供了一个令人期待的框架,使机器人能够从人类用户处获取多样化技能。然而,大多数模仿学习算法假设可以获得高质量的演示,这在收集来自非专家用户的数据时是不切实际的,因为这些演示常常包含无意的错误。 naively 从此类演示中学习可能导致不安全的策略行为,而因偶发错误而丢弃整个演示则会浪费宝贵的数据,尤其是在数据稀缺的场景中。本文引入了 GiB(Good-in-Bad)算法,自动识别并丢弃演示中含有错误的子任务,同时保留高质量的子任务。筛选后的数据可供任何策略学习算法使用,以训练更稳健的策略。GiB 首先训练一个自监督模型来学习潜在特征并为每个演示分配二元权重,以确定其为良好或差差。它随后对高质量子任务的潜在特征分布进行建模,并使用马哈努里距离来检测和评估质量较差的子任务。我们在 Franka 机器人上对 GiB 进行了在模拟和真实世界的多步骤任务中的验证,结果表明从混合质量的人类演示中学习可显著提升策略性能。

关键词

引用

@article{arxiv.2605.01529,
  title  = {Good in Bad (GiB): Sifting Through End-user Demonstrations for Learning a Better Policy},
  author = {Noushad Sojib and Ola Ghattas and Momotaz Begum},
  journal= {arXiv preprint arXiv:2605.01529},
  year   = {2026}
}