利用在线经验策展演示数据
机器人学
2025-07-23 v2 人工智能
机器学习
摘要
许多机器人演示数据集包含质量各异的异构演示。这种异质性可能有利于策略预训练,但当与最终的模仿学习目标结合使用时,可能会阻碍机器人性能。特别是,数据中的某些策略可能不如其他策略可靠,或者在数据中代表性不足,导致在测试时采样到这些策略时性能不佳。此外,即使对于人类来说,识别这些不可靠或代表性不足的策略也很困难,而筛选演示数据集既耗时又昂贵。另一方面,在这些演示上训练的策略性能可以反映不同策略的可靠性。因此,我们提出让机器人基于在线机器人经验进行自我策展(Demo-SCORE)。具体而言,我们训练并交叉验证一个分类器来区分成功的策略 rollout 和不成功的策略 rollout,并使用该分类器来过滤异构演示数据集。我们在仿真和真实世界中的实验表明,Demo-SCORE可以在无需人工策展的情况下有效识别次优演示。值得注意的是,与使用所有原始演示训练的基础策略相比,Demo-SCORE使所得策略的绝对成功率提高了15-35%。
引用
@article{arxiv.2503.03707,
title = {Curating Demonstrations using Online Experience},
author = {Annie S. Chen and Alec M. Lessing and Yuejiang Liu and Chelsea Finn},
journal= {arXiv preprint arXiv:2503.03707},
year = {2025}
}