中文

基于轨迹熵最大化的大规模自动驾驶数据集高效数据剪枝

机器人学 2025-12-23 v1

摘要

收集大规模自然istic驾驶数据对于训练稳健的自动驾驶规划器至关重要。然而,现实数据集常包含大量重复且低价值的样本,这会导致存储成本的增加,并为策略学习带来有限的收益。为解决此问题,我们提出一种信息论数据剪枝方法,有效减少训练数据的体积而不损害模型性能。我们的方法评估驾驶数据的时间序列分布信息熵,并迭代选择保留原始数据集统计特征的高价值样本,以模型不可知的方式。从理论角度看,我们表明最大化轨迹熵有效约束了被剪枝子集与原始数据分布之间的KL散度,从而保持泛化能力。在大规模模仿学习框架下的NuPlan基准上的全面实验表明,所提方法可在保持闭环性能的同时,将数据集大小降低最高可达40%。本工作提供了一种轻量且在理论上有据可循的大规模数据管理和高效策略学习方法。

关键词

引用

@article{arxiv.2512.19270,
  title  = {Are All Data Necessary? Efficient Data Pruning for Large-scale Autonomous Driving Dataset via Trajectory Entropy Maximization},
  author = {Zhaoyang Liu and Weitao Zhou and Junze Wen and Cheng Jing and Qian Cheng and Kun Jiang and Diange Yang},
  journal= {arXiv preprint arXiv:2512.19270},
  year   = {2025}
}

备注

7 pages, 4 figures