中文

使用结构化矩阵定制 Softmax 注意力的归纳偏置

机器学习 2025-09-10 v1

摘要

注意力的核心组件是评分函数,它将输入转换为低维查询和键,并对每对输入取点积。虽然低维投影提高了效率,但它会导致某些具有内在高维输入的任务的信息损失。此外,注意力对所有输入对使用相同的评分函数,而不对序列中相邻标记施加距离依赖的计算偏置。在本工作中,我们通过提出基于计算高效的高秩结构化矩阵的新评分函数来解决这些不足,包括块张量链(Block Tensor-Train, BTT)和多级低秩(Multi-Level Low Rank, MLR)矩阵。在具有高维输入的上下文回归任务中,我们提出的评分函数在任何固定计算预算下均优于标准注意力。在语言建模这一表现出局域性模式的任务中,我们基于 MLR 的注意力方法相比标准注意力和滑动窗口注意力变体实现了改进的标度律。此外,我们证明 BTT 和 MLR 均属于更广泛的高效结构化矩阵家族,能够编码全秩或距离依赖的计算偏置,从而解决了标准注意力的重大不足。最后,我们证明 MLR 注意力在长程时间序列预测中具有前景。

关键词

引用

@article{arxiv.2509.07963,
  title  = {Customizing the Inductive Biases of Softmax Attention using Structured Matrices},
  author = {Yilun Kuang and Noah Amsel and Sanae Lotfi and Shikai Qiu and Andres Potapczynski and Andrew Gordon Wilson},
  journal= {arXiv preprint arXiv:2509.07963},
  year   = {2025}
}

备注

ICML 2025. Code available at https://github.com/YilunKuang/structured-attention