中文

自注意力机制是否需要独立的权重?

人工智能 2024-12-03 v1 计算机视觉与模式识别

摘要

自注意力的成功在于其捕获长程依赖并增强上下文理解的能力,但其计算复杂度限制了其处理具有内在方向性的序列数据的能力。本工作引入了基于共享权重的自注意力BERT模型,该模型仅学习Key、Value和Query表示的一个权重矩阵,而不是三个独立矩阵。我们的共享注意力机制将训练参数规模缩小一半以上,训练时间缩短约为五分之一。此外,我们在GLUE数据集上的小型任务中证明了该模型在准确率上优于BERT基线,特别是在噪声和超出域数据上的泛化能力更佳。实验结果表明,共享自注意力方法在注意力块中的参数规模降低了66.53%。在GLUE数据集上,基于共享权重自注意力的BERT模型在标准、对称和成对注意力基于BERT的模型中的准确率分别提高了0.38%、5.81%和1.06%。该模型和源代码均可在Anonymous处获取。

关键词

引用

@article{arxiv.2412.00357,
  title  = {Safety Alignment Backfires: Preventing the Re-emergence of Suppressed Concepts in Fine-tuned Text-to-Image Diffusion Models},
  author = {Sanghyun Kim and Moonseok Choi and Jinwoo Shin and Juho Lee},
  journal= {arXiv preprint arXiv:2412.00357},
  year   = {2024}
}

备注

20 pages, 18 figures