模仿学习中的数据质量
机器人学
2023-06-06 v1 机器学习
摘要
在监督学习中,数据质量与整理的问题近年来已被能够摄取互联网规模数据的愈发强大且具表现力的模型所掩盖。然而,在机器人离线学习中,我们根本缺乏互联网规模的数据,因此高质量数据集是必需的。这在模仿学习(IL)中尤为如此,IL是一种利用专家示范进行机器人学习的样本高效范式。通过IL学习的策略由于动作预测的复合误差在测试时遭受状态分布偏移,导致策略无法从中恢复的非可见状态。相较于设计新算法应对分布偏移,另一种视角是开发评估与整理数据集的新方法。越来越多的证据表明,相同的IL算法在不同数据集上性能可能有显著差异。这呼吁一种用于定义“数据质量”度量并进一步用于数据整理的形式化方法。本工作中,我们透过分布偏移的视角,朝形式化模仿学习数据质量迈出第一步:高质量数据集促使策略在测试时保持分布内。我们提出塑造数据集质量的两个基本属性:i)动作散度:在特定状态下专家策略与所学策略的不匹配;ii)转移多样性:给定状态与动作下系统中存在的噪声。我们从理论上研究了这两个关键属性在模仿学习中的联合效应,并实证分析了在多种不同数据源上训练的模型。我们表明状态多样性并非总是有益的,并展示了动作散度与转移多样性在实践中的相互作用。
引用
@article{arxiv.2306.02437,
title = {Data Quality in Imitation Learning},
author = {Suneel Belkhale and Yuchen Cui and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2306.02437},
year = {2023}
}