中文

基于梯度数据估值提升博弈论运动规划的课程学习

机器学习 2026-04-02 v1 系统与控制 系统与控制

摘要

我们证明,基于梯度数据估值产生的课程排序显著优于元数据启发式方法,用于训练博弈论运动规划器。具体而言,我们将 TracIn 梯度相似度评分应用于 GameFormer,在 nuPlan 基准上构建了一个课程,根据其对验证损失降低的估计贡献为训练场景加权。在三个随机种子上,TracIn 加权课程的平均规划 ADE 为 1.704±0.0291.704\pm0.029\,m,显著优于基于元数据的交互难度课程(1.822±0.0141.822\pm0.014\,m;配对 tt 检验 p=0.021p=0.021,Cohen's dz=3.88d_z=3.88),同时表现出比均匀基线(1.772±0.1341.772\pm0.134\,m)更低的方差。我们的分析显示,TracIn 评分与场景元数据几乎正交(Spearman ρ=0.014\rho=-0.014),表明基于梯度的估值捕获了手工特征无法捕捉的训练动态。我们进一步证明,基于梯度的课程加权在硬数据选择失败时同样有效:TracIn 精选的 20% 子集使性能下降 2×2\times,而使用相同评分的全数据课程加权则产生最佳结果。这些发现确立了基于梯度数据估值作为提升博弈论规划样本效率的实用工具。

关键词

引用

@article{arxiv.2604.00388,
  title  = {Gradient-Based Data Valuation Improves Curriculum Learning for Game-Theoretic Motion Planning},
  author = {Shihao Li and Jiachen Li and Dongmei Chen},
  journal= {arXiv preprint arXiv:2604.00388},
  year   = {2026}
}