注意力学习器的非参数教学
机器学习
2026-02-25 v1
摘要
注意力学习器(如变换器)在学习将序列与其对应属性(例如将给定的标记序列映射到下一个标记的概率)之间的隐式关系方面表现出色。然而,这一学习过程往往代价高昂。为此,我们提出了一种名为 Attention Neural Teaching(AtteNT)的新范式,通过非参数教学视角重新解释学习过程。具体而言,后者通过示例选择提供一种对隐式定义(即非参数)映射的教学框架。这种隐式映射通过一组密集的序列-属性对来体现,AtteNT 教师从中选择子集以加速注意力学习器训练中的收敛。在我们分析注意力在基于参数的梯度下降期间的作用,并将注意力学习器由参数更新所塑造的演化通过非参数教学中的函数梯度下降重新表述后,我们首次表明,通过非参数教学来教学注意力学习器是与教学重要性自适应非参数学习器相一致的。这一新发现使 AtteNT 能够显著提升注意力学习器的学习效率。具体而言,我们观察到在 LLMs 和 ViTs 上分别实现了 13.01% 和 20.58% 的训练时间缩短,涵盖微调和从头训练两种情形。关键的是,这些收益是在不牺牲准确性的前提下实现的;事实上,在多样化的下游任务上,性能始终保持一致甚至得到提升。
引用
@article{arxiv.2602.20461,
title = {Nonparametric Teaching of Attention Learners},
author = {Chen Zhang and Jianghui Wang and Bingyang Cheng and Zhongtao Chen and Wendong XU and Cong Wang and Marco Canini and Francesco Orabona and Yik Chung WU and Ngai Wong},
journal= {arXiv preprint arXiv:2602.20461},
year = {2026}
}
备注
ICLR 2026 (36 pages, 6 figures)