中文

用于长上下文知识迁移的生成扩散先验蒸馏

机器学习 2026-05-13 v1 人工智能

摘要

传统的时间序列分类器假设在推理时输入完整序列,但实际约束(延迟和成本)通常将输入限制为部分前缀。部分数据中类别判别模式的缺失会严重阻碍分类器的泛化能力。本工作利用知识蒸馏(KD)赋予部分时间序列分类器与其完整序列对应物相当的泛化能力。在KD中,高容量教师网络传递监督信号以辅助学生网络在目标任务上的学习。与教师特征进行匹配在缩小因参数容量有限导致的泛化差距方面已显示出潜力。然而,当泛化差距源于训练数据差异(完整序列与部分序列)时,教师的完整上下文特征对学生网络的短上下文特征来说可能是一个压倒性的目标信号。为了提供渐进、多样且集体的教师监督,我们提出了生成扩散先验蒸馏(GDPD),这是一种新颖的KD框架,将短上下文学生特征视为目标完整上下文特征的退化观测。受扩散模型迭代恢复能力的启发,我们学习了一个基于扩散的教师特征生成先验。利用此先验,我们对最能解释学生特征中缺失的长程信息的目标教师表示进行后验采样,并优化学生特征,使其相对于这些目标的退化程度最小。GDPD为每个学生特征提供了与任务相关的长上下文知识分布,这有利于部分分类任务的学习。在不同提前量设置、数据集和架构上的大量实验证明了GDPD在完整到部分蒸馏中的有效性。

关键词

引用

@article{arxiv.2605.11414,
  title  = {Generative Diffusion Prior Distillation for Long-Context Knowledge Transfer},
  author = {Nilushika Udayangani and Kishor Nandakishor and Marimuthu Palaniswami},
  journal= {arXiv preprint arXiv:2605.11414},
  year   = {2026}
}

备注

Published as a conference paper at ICLR 2026 (Brazil, Rio de Janeiro)