基于光滑伪投影器的Transformer模型纠错
机器学习
2026-03-11 v1 人工智能
摘要
伪投影器是一种轻量级修改,可集成到现有语言模型和其他神经网络中,而无需改变其核心架构。它可以被视为一种隐藏表示纠正器,通过抑制由与标签无关输入内容诱导的方向来降低对噪声的敏感性。该设计受到多网格(MG)范例的启发,最初是为了加速求解偏微分方程和边值问题的迭代求解器,后来扩展到更一般的线性系统通过代数多网格方法。我们将该方法称为伪投影器,因为其线性原型对应于严格的幂等正交投影器,而实际公式采用可学习的限制和延拨算子,因此通常不满足确切正交投影的属性。我们在基于Transformer的文本分类任务以及受控人工基准上评估了所提出的方法,展示了其在改善训练动力学和鲁棒性方面的有效性。实验结果以及支持性理论启发式显示,在各种设置下,训练行为均表现出一致的改进,且未观察到其他不利影响。我们的下一步工作将将此方法扩展到语言模型。
引用
@article{arxiv.2603.09815,
title = {Correction of Transformer-Based Models with Smoothing Pseudo-Projector},
author = {Vitaly Bulgakov},
journal= {arXiv preprint arXiv:2603.09815},
year = {2026}
}
备注
29 pages, 23 figures