用于高效多尺度序列处理的分数神经注意力
机器学习
2025-11-14 v1 人工智能
动力系统
概率论
生物物理
摘要
注意力机制支撑着 Transformer 模型的计算能力,该模型在各个领域均取得了显著成功。然而,理解和扩展自注意力背后的原理仍然是推进人工智能的关键挑战。受生物注意力多尺度动力学和动力系统理论的启发,我们引入了分数神经注意力(FNA),一种用于多尺度信息处理的、有原则的神经科学启发框架。FNA 通过由分数拉普拉斯算子控制的 Lévy 扩散对 token 交互进行建模,本质上实现了跨多个尺度的短程和长程依赖的同步。该机制产生了更高的表达能力和更快的信息混合,提升了 Transformer 的基础能力。在理论上,我们表明 FNA 的动力学受分数扩散方程控制,且由此产生的注意力网络展现出更大的谱隙和更短的路径长度——这是计算效率增强的机制特征。在实验上,FNA 即使在单层和单头的情况下也能实现具有竞争力的文本分类性能;它还提升了图像处理和神经机器翻译的性能。最后,来自几何调和的扩散图算法能够在保持嵌入和隐藏状态内在结构的同时,降低 FNA 权重的维度。总而言之,这些结果将 FNA 确立为连接自注意力、随机动力学和几何的有原则的机制,为强大的、受神经科学启发的 AI 提供了可解释的、具有生物学基础的基础。
引用
@article{arxiv.2511.10208,
title = {Fractional neural attention for efficient multiscale sequence processing},
author = {Cheng Kevin Qu and Andrew Ly and Pulin Gong},
journal= {arXiv preprint arXiv:2511.10208},
year = {2025}
}