基于正规化Wasserstein近端算子与L1先验的稀疏Transformer架构
机器学习
2025-10-21 v1 最优化与控制
机器学习
摘要
本文提出一种稀疏Transformer架构,将关于数据分布的先验信息直接融入神经网络的Transformer结构中。该模型的设计灵感来自一种特殊的最优传输问题,即正规化Wasserstein近端算子,其具有闭式解,实际上是Transformer架构的一种特殊表征。与经典基于流的方法相比,所提方法改善了优化问题的凸性特性,促进生成样本的稀疏性。通过理论分析和数值实验,包括生成模型和贝叶斯逆问题中的应用,结果表明稀疏Transformer在准确率和收敛速度方面均优于经典神经ODE方法。
引用
@article{arxiv.2510.16356,
title = {Sparse Transformer Architectures via Regularized Wasserstein Proximal Operator with $L_1$ Prior},
author = {Fuqun Han and Stanley Osher and Wuchen Li},
journal= {arXiv preprint arXiv:2510.16356},
year = {2025}
}