p-Laplacian Transformer
机器学习
2023-11-07 v1 计算与语言
机器学习
摘要
-Laplacian 正则化根植于图与图像信号处理,引入参数 以控制对这些数据的正则化效应。较小的 值促进稀疏性与可解释性,而较大的 值鼓励更平滑的解。在本文中,我们首先表明自注意力机制获得了极小拉普拉斯正则化()并在架构中鼓励平滑性。然而,平滑性并不适用于 transformer 中自注意力的异配结构,其中对邻近与非邻近 token 之间的注意力权重被无差别地分配。基于该洞见,我们进而提出一类新型 transformer,即 -Laplacian Transformer (p-LaT),其利用 -Laplacian 正则化框架来驾驭自注意力层内的异配特征。特别地,低 值将有效地为与当前正处理 token 邻近的 token 分配更高的注意力权重。我们在广泛基准数据集上实证展示了 p-LaT 相对于基线 transformer 的优势。
引用
@article{arxiv.2311.03235,
title = {p-Laplacian Transformer},
author = {Tuan Nguyen and Tam Nguyen and Vinh Nguyen and Tan M. Nguyen},
journal= {arXiv preprint arXiv:2311.03235},
year = {2023}
}