中文

ASkDAgger: 用于交互式模仿学习的主动技能水平数据聚合

机器学习 2025-08-08 v1 人工智能 人机交互 机器人学

摘要

人类教学工作量是交互式模仿学习更广泛适用性的重要瓶颈。为减少所需查询次数,现有方法采用主动学习,在不确定、危险或新颖的情况下仅查询人类教师。然而,在这些查询期间, novice 的计划动作未被利用 despite 包含有价值信息,如 novice 的能力以及相应的不确定性水平。为此,我们允许 novice 说:“我计划这样做,但我不确定。”我们引入主动技能水平数据聚合(ASkDAgger)框架,该框架通过三种关键方式利用教师对 novice 计划的反馈:(1)S-感知门控(SAG):调整门控阈值以跟踪灵敏度、特异度或最低成功率;(2)前瞻交互经验回放(FIER),将有效且重新标记的 novice 动作计划重新构构为演示;(3)优先级交互经验回放(PIER),根据不确定性、novice 成功情况和演示年龄进行优先级排序。这些组件共同平衡了查询频率与失败发生率,减少了所需的演示标注次数,提高了泛化能力,并加速了对变化领域的适应。我们通过语言条件化的操纵任务在仿真和真实世界环境中验证了ASkDAgger的有效性。代码、数据和视频均可在https://askdagger.github.io获取。

关键词

引用

@article{arxiv.2508.05310,
  title  = {ASkDAgger: Active Skill-level Data Aggregation for Interactive Imitation Learning},
  author = {Jelle Luijkx and Zlatan Ajanović and Laura Ferranti and Jens Kober},
  journal= {arXiv preprint arXiv:2508.05310},
  year   = {2025}
}

备注

Accepted for publication in Transactions on Machine Learning Research (TMLR, 2025)