中文

面向稀疏 token 分类的单层注意力高维分析

机器学习 2025-09-30 v1 机器学习

摘要

注意力机制何时以及如何能够学会选择性地关注信息 token,从而实现对微弱、稀有且稀疏分布特征的检测?我们在一个稀疏 token 分类模型中从理论上探讨了这些问题,其中正样本在随机选取的 token 子集中嵌入微弱信号向量,而负样本为纯噪声。在长序列极限下,我们表明当信号强度仅随序列长度 LL 呈对数级增长时,简单的单层注意力分类器原则上即可实现趋于零的测试误差,而线性分类器则需要 L\sqrt{L} 的缩放。从表示能力转向可学习性,我们在样本量与嵌入维度成比例增长的高维情形下研究了有限 LL 时的训练过程。我们证明仅需两次梯度更新,注意力分类器的查询权重向量即可与隐藏信号获得非平凡的对齐,从而引发选择性放大信息 token 的注意力图。我们进一步推导了训练后的基于注意力的分类器测试误差与训练损失的精确渐近表达式,并量化了其容量——即通常能被完美分割的最大数据集大小——从而解释了自适应 token 选择优于非自适应线性基线的优势。

关键词

引用

@article{arxiv.2509.25153,
  title  = {High-Dimensional Analysis of Single-Layer Attention for Sparse-Token Classification},
  author = {Nicholas Barnfield and Hugo Cui and Yue M. Lu},
  journal= {arXiv preprint arXiv:2509.25153},
  year   = {2025}
}