面向不平衡数据集的平衡行为克隆
机器人学
2026-01-06 v2
摘要
机器人应能够从人类演示中学习复杂行为。在实际情况下,这些由人类提供的数据集不可避免地是不平衡的:即,人类对某些子任务的演示频率高于其他子任务。最先进的方法默认将人类数据集的每个元素视为 equally important。如果——例如——人类数据的大部分 focuses on 达成目标,而只有少量 state-action 对用于避免障碍物,那么学习算法就会更加强调目标达成。更一般地,数据量与数据重要性之间的不匹配会导致模仿学习方法的根本性问题。本文分析并发展了能够自动考虑混合数据集的学习方法。我们形式化地证明,在对每个 state-action 对赋予相等权重的情况下,不平衡数据导致不平衡的策略;这些策略模仿最被表示的行为,而非人类的复杂、多任务演示。接下来,我们探索了在无需人工监督的情况下对离线数据集进行再平衡(即对不同 state-action 对的重要性进行重新加权)的算法。对数据集进行再平衡可提升整体策略性能。然而,没有免费的午餐:每种自主再平衡方法都有自己的优缺点。我们对这些优势和劣势进行了表述,帮助其他研究人员确定何时使用哪种方法最为合适。我们通过引入一种新型的 meta-gradient 再平衡算法来解决现有方法的主要局限性。我们的实验表明,数据集再平衡导致更好的下游学习,在不要求额外数据收集的情况下提高了通用模仿学习算法的性能。详见我们的项目网站:https://collab.me.vt.edu/data_curation/。
引用
@article{arxiv.2508.06319,
title = {Towards Balanced Behavior Cloning from Imbalanced Datasets},
author = {Sagar Parekh and Heramb Nemlekar and Dylan P. Losey},
journal= {arXiv preprint arXiv:2508.06319},
year = {2026}
}