中文

我的行为克隆策略泛化性如何?面向可信性能评估的统计方法

机器人学 2024-10-24 v2 人工智能 机器学习 应用统计

摘要

随着机器人策略学习中随机生成模型的兴起,端到端视觉运动策略通过从人类演示中学习,在解决复杂任务方面变得越来越成功。然而,由于现实世界评估的成本使得用户只能进行少量的策略 rollout,准确衡量此类策略的性能仍然是一个挑战。分布偏移导致部署期间性能发生不可预测的变化,进一步加剧了这一问题。为了严格评估行为克隆策略,我们提出了一个框架,该框架使用最少数量的实验性策略 rollout,为任意环境中的机器人性能提供严格的下界。值得注意的是,通过将标准随机排序应用于机器人性能分布,我们为给定任务的整个性能分布(通过累积分布函数的界)提供了最坏情况界。我们基于已有的统计结果,确保这些界以用户指定的置信水平和紧度成立,并且由尽可能少的策略 rollout 构造而成。在实验中,我们在仿真和硬件上评估了视觉运动操作策略。具体而言,我们 仿真操作环境中经验性地验证了界的保证, 找出了在硬件上部署的学习策略对新现实环境泛化的程度,以及 严格比较了在分布外设置下测试的两种策略。我们的实验数据、代码以及置信界的实现均已开源。

关键词

引用

@article{arxiv.2405.05439,
  title  = {How Generalizable Is My Behavior Cloning Policy? A Statistical Approach to Trustworthy Performance Evaluation},
  author = {Joseph A. Vincent and Haruki Nishimura and Masha Itkina and Paarth Shah and Mac Schwager and Thomas Kollar},
  journal= {arXiv preprint arXiv:2405.05439},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication