中文

你的模仿学习策略比我的更好吗?基于近最优停止的策略比较

机器人学 2025-06-09 v4 机器学习

摘要

模仿学习使机器人能够在具有挑战性的灵巧操作环境中执行复杂的长时程任务。随着新方法的开发,必须通过反复评估试验对它们进行严格评估,并与相应的基线进行比较。然而,由于巨大的人力投入和策略有限的推理吞吐量,策略比较从根本上受到较小可行样本量(例如 10 或 50)的制约。本文提出了一种新颖的统计框架,用于在小样本量情况下严格比较两种策略。先前的统计策略比较工作依赖于批量检验,这需要固定且预先确定的试验次数,且缺乏根据观察到的评估数据调整样本量的灵活性。此外,通过增加额外试验来扩展检验可能会导致无意的 p-hacking,从而破坏统计保证。相比之下,我们提出的统计检验是序贯的,允许研究人员根据中间结果决定是否继续进行试验。这能够自适应地将试验次数调整至适应底层比较的难度,在不牺牲概率正确性的前提下节省了大量时间和精力。大量的数值仿真和真实世界机器人操作实验表明,我们的检验实现了近最优停止,让研究人员能够在近最少的试验次数内停止评估并做出决策。具体而言,与最先进的基线相比,它将评估试验次数减少了多达 32%,同时保持了比较的概率正确性和统计功效。此外,我们的方法在最具挑战性的比较实例(需要最多评估试验)中表现最强;在多任务比较场景中,我们为评估者节省了超过 160 次仿真 rollout。

关键词

引用

@article{arxiv.2503.10966,
  title  = {Is Your Imitation Learning Policy Better than Mine? Policy Comparison with Near-Optimal Stopping},
  author = {David Snyder and Asher James Hancock and Apurva Badithela and Emma Dixon and Patrick Miller and Rares Andrei Ambrus and Anirudha Majumdar and Masha Itkina and Haruki Nishimura},
  journal= {arXiv preprint arXiv:2503.10966},
  year   = {2025}
}

备注

14 + 5 pages, 10 figures, 4 tables. Accepted to RSS 2025