中文

Observation Space Shift 的基准测试——面向长期任务的 BOSS

机器人学 2025-02-24 v1 人工智能 计算机视觉与模式识别

摘要

机器人领域长期以来希望开发出能够完成以前未见过的长期任务的视觉控制机器人。层次化方法为实现这一目标提供了可能路径,通过执行由任务规划器安排的技能组合,每种视觉运动技能都使用特定的模仿学习算法进行预训练。然而,即使在像技能链这样的简单长期任务中,层次化方法也常常因我们识别出的“观察空间偏移”(OSS)问题而难以克服,该问题表现为前序技能的顺序执行导致观察空间发生偏移,从而扰乱后续单独训练技能策略的性能。为验证 OSS 及其对长期任务的影响,我们提出 BOSS(Observation Space Shift 的基准测试),BOSS 包含三个不同挑战:“单一谓词偏移”、“累积谓词偏移”和“技能链”,每个挑战旨在评估 OSS 不同负面作用的不同方面。我们在 BOSS 上评估了几种近期流行的模仿学习算法,包括三种行为克隆方法以及视觉语言动作模型 OpenVLA。即便在最简单的挑战中,我们也观察到在有无 OSS 情况下进行技能性能比较时,分别出现 67%、35%、34% 和 54% 的平均性能下降。此外,我们还研究了解决 OSS 的潜在方法,即通过扩大每个技能的训练数据,采用更大尺度且视觉上更具多样性的演示集进行训练,我们的结果显示该方法并不足以解决 OSS。项目页面: https://boss-benchmark.github.io/

关键词

引用

@article{arxiv.2502.15679,
  title  = {BOSS: Benchmark for Observation Space Shift in Long-Horizon Task},
  author = {Yue Yang and Linfeng Zhao and Mingyu Ding and Gedas Bertasius and Daniel Szafir},
  journal= {arXiv preprint arXiv:2502.15679},
  year   = {2025}
}