中文

Transformer 中添加 PDE 扩散的 optimal 位置探讨

机器学习 2026-02-17 v3 人工智能

摘要

Transformer 通过自注意力实现强大的基于内容的全局路由,但缺乏沿序列轴的显式局部几何先验。因此,局部诱导模块在混合体系结构中的位置 largely 基于经验。我们研究了一个简单确定性的 PDE 扩散层,其作为一维热平滑的显式欧拉步骤,在谱稳定性约束下使用离散 Neumann 拉普拉斯算子实现,并提出结构性问题:扩散应相对于注意力插入的位置安排。我们的核心主张是扩散与注意力一般不交换,因此在注意力前后插入相同的局部算子会导致行为呈本质不同。我们发展了三层算子理论框架:(1) 为扩散子系统建立无条件保证,包括谱非扩张性和当扩散步长小于 1/2 时的单调 Dirichlet 能量耗散;(2) 推导组成性扰动界,将插入效应链接到表示粗糙度和下游放大;(3) 将扩散-注意力非交换性用作结构双混合冲突的诊断工具。基于理论,我们在 Long Range Arena 基准上评估了七个插入位置。早期扩散作为有效的预正则化,在嵌入后应用时将平均准确率提高 4.1 个百分点,而后置扩散则使性能下降 2.5 个百分点,与预测的冲突一致。在相同的全局稳定性约束下,多尺度扩散变体可实现持续的性能提升。我们的分析为通过分离可证明保证、组成界限和机制诊断来推理序列模型中的局部-全局组成提供了通用模板。

关键词

引用

@article{arxiv.2510.03272,
  title  = {Where to Add PDE Diffusion in Transformers},
  author = {Yukun Zhang and Xueqing Zhou},
  journal= {arXiv preprint arXiv:2510.03272},
  year   = {2026}
}