AttentionDrop:面向 Transformer 模型的新型正则化方法
计算机视觉与模式识别
2025-09-22 v2 人工智能
机器学习
摘要
Transformer 架构在自然语言处理、计算机视觉和语音处理等广泛任务上实现了最先进的性能,但其巨大的模型容量常导致过拟合,尤其在训练数据有限或噪声较大时。为此,本研究提出了一统一的随机正则化技术族,即AttentionDrop,其包含三种不同变体,直接作用于自注意力分布上。硬注意力掩码随机消零前k个注意力逻辑,以鼓励多样化的上下文利用;模糊注意力平滑应用动态高斯卷积,对注意力逻辑进行平滑处理,以缓解过于尖锐的分布;一致性正则化AttentionDrop通过KL 基于一致性损失,强制在多个独立的AttentionDrop扰动下输出保持稳定。研究结果表明,AttentionDrop 在准确率、校准性和对抗鲁棒性方面,均优于标准Dropout、DropConnect和R-Drop等基线方法。
关键词
引用
@article{arxiv.2504.12088,
title = {AttentionDrop: A Novel Regularization Method for Transformer Models},
author = {Mirza Samad Ahmed Baig and Syeda Anshrah Gillani and Abdul Akbar Khan and Shahid Munir Shah and Muhammad Omer Khan},
journal= {arXiv preprint arXiv:2504.12088},
year = {2025}
}
备注
25 pages