中文

深度方向注意力(DWAtt):一种数据高效的分类层融合方法

计算与语言 2024-05-08 v2 机器学习

摘要

在大规模文本数据上预训练的语言模型已被证明能同时编码不同类型的知识。传统上,在适配新任务或新数据时仅使用最后一层的特征。我们提出,在使用或微调深度预训练模型时,可能与下游任务相关的中间层特征被埋藏得过深,以至于在所需样本或步数方面无法被高效利用。为验证这一点,我们提出一种新的层融合方法:深度方向注意力(DWAtt),以帮助重新浮现非最终层的信号。我们将 DWAtt 与基于拼接的基本层融合方法(Concat)进行比较,并将两者与更深的模型基线进行比较——均保持在相似的参数预算内。我们的发现表明,DWAtt 和 Concat 比基线更具步数与样本效率,尤其在少样本设定下。DWAtt 在较大数据规模上优于 Concat。在 CoNLL-03 NER 上,层融合在不同少样本规模下展现出 3.68–9.73% 的 F1 提升。所提出的层融合模型在各种不同数据规模、架构与训练约束的训练场景中均显著优于基线。

关键词

引用

@article{arxiv.2209.15168,
  title  = {Depth-Wise Attention (DWAtt): A Layer Fusion Method for Data-Efficient Classification},
  author = {Muhammad ElNokrashy and Badr AlKhamissi and Mona Diab},
  journal= {arXiv preprint arXiv:2209.15168},
  year   = {2024}
}

备注

Accepted Oral Presentation at LREC-COLING 2024; 10 pages, 9 figures