中文

算法保证:蒸馏监督学习与离线强化学习数据集

机器学习 2025-12-02 v1 机器学习

摘要

给定训练数据集,数据蒸馏的目标是从中派生出合成数据集,使得在后者上训练的模型表现与在训练数据集上训练的模型相近。在本工作中,我们开发并分析了一种用于监督学习(具体为Rd\mathbb{R}^d中的回归)的数据蒸馏算法,基于匹配相对于固定随机抽样回归器集的训练集和合成数据集上的损失,而无需任何模型训练。我们的首要贡献是一种新型性能保证,证明该算法仅需O~(d2)\tilde{O}(d^2)个抽样回归器即可派生出合成数据集,使得对任何有界线性模型的MSE损失几乎与其在给定训练数据上的MSE损失相同。特别是,优化后者的模型在训练数据上的损失接近最小值,从而几乎等同于优化前者的模型。补充而言,我们还证明了抽样回归器数量的匹配下界为Ω(d2)\Omega(d^2),显示了我们分析的紧密性。我们的第二个贡献是将该算法扩展到离线RL数据蒸馏,通过匹配Bellman损失,不同于以往使用行为克隆目标的工作。这是一个首次利用离线RL数据集中可用奖励和下一个状态信息、无需任何策略模型优化的方法。我们的算法生成的合成数据集,其Bellman损失相对于任何线性动作价预测器几乎与其在离线RL训练数据集上的Bellman损失相同。因此,优化后者的动作价预测器所关联的策略在训练数据上表现几乎等同于优化前者的策略。我们进行实验以验证理论保证,观察到性能提升。

关键词

引用

@article{arxiv.2512.00536,
  title  = {Algorithmic Guarantees for Distilling Supervised and Offline RL Datasets},
  author = {Aaryan Gupta and Rishi Saket and Aravindan Raghuveer},
  journal= {arXiv preprint arXiv:2512.00536},
  year   = {2025}
}

备注

29 pages, 2 figures