可实际衡量的多样性:面向机器人数据集的快速、无模型多样性度量
机器人学
2026-03-13 v1
摘要
机器人 imitation learning 数据集通常由不同时长的轨迹组成,涵盖状态、动作和高维观察(如 RGB 视频),这使得以尊重轨迹结构和几何特性的方式量化多样性变得非平凡。我们将香农熵和 von Neumann 熵扩展到此场景,通过在演示数据的 Gram 矩阵上基于签名转换的核函数上定义签名变换熵,得到可直接作用于演示数据集的熵和多样性度量。基于这些度量,我们研究数据多样性对机器人 imitation learning 中泛化性能的影响,并提出一种简单、无模型的方式来筛选多样化演示。我们引入 FAKTUAL(FAst trajectory Kernel enTropy cUration for imitation Learning),一种数据筛选算法,通过在子集大小预算下选择最大化熵的演示子集来实现。FAKTUAL 完全无模型,无需访问 imitation 策略或 rollouts,仅对策略训练产生微小的额外开销。在图像和基于状态的 RoboMimic 与 MetaWorld benchmark 以及四个真实世界操作任务上进行评估。在各种任务和架构下,利用 FAKTUAL 的多样性感知筛选始终在随机选择之上实现了显著提升的下游成功率,而且在最新机器人数据筛选方法中计算效率显著更高。我们的结果表明,演示数据集的熵是理解和改进机器人 imitation learning 数据集多样性的实用工具。
引用
@article{arxiv.2603.11634,
title = {Diversity You Can Actually Measure: A Fast, Model-Free Diversity Metric for Robotics Datasets},
author = {Sreevardhan Sirigiri and Nathan Samuel de Lara and Christopher Agia and Florian Shkurti and Fabio Ramos},
journal= {arXiv preprint arXiv:2603.11634},
year = {2026}
}