中文

p-Laplacian Transformer

机器学习 2023-11-07 v1 计算与语言 机器学习

摘要

pp-Laplacian 正则化根植于图与图像信号处理,引入参数 pp 以控制对这些数据的正则化效应。较小的 pp 值促进稀疏性与可解释性,而较大的 pp 值鼓励更平滑的解。在本文中,我们首先表明自注意力机制获得了极小拉普拉斯正则化(p=2p=2)并在架构中鼓励平滑性。然而,平滑性并不适用于 transformer 中自注意力的异配结构,其中对邻近与非邻近 token 之间的注意力权重被无差别地分配。基于该洞见,我们进而提出一类新型 transformer,即 pp-Laplacian Transformer (p-LaT),其利用 pp-Laplacian 正则化框架来驾驭自注意力层内的异配特征。特别地,低 pp 值将有效地为与当前正处理 token 邻近的 token 分配更高的注意力权重。我们在广泛基准数据集上实证展示了 p-LaT 相对于基线 transformer 的优势。

关键词

引用

@article{arxiv.2311.03235,
  title  = {p-Laplacian Transformer},
  author = {Tuan Nguyen and Tam Nguyen and Vinh Nguyen and Tan M. Nguyen},
  journal= {arXiv preprint arXiv:2311.03235},
  year   = {2023}
}