中文

用于文本分类的多尺度自注意力

计算与语言 2019-12-03 v1 机器学习

摘要

在本文中,我们将先验知识——多尺度结构——引入自注意力模块。我们提出了一种多尺度 Transformer,它使用多尺度多头自注意力来从不同尺度捕获特征。基于语言学视角以及对预训练 Transformer(BERT)在大型语料库上的分析,我们进一步设计了一种策略来控制每一层的尺度分布。三类不同任务(21 个数据集)的结果表明,我们的多尺度 Transformer 在中小规模数据集上持续且显著优于标准 Transformer。

关键词

引用

@article{arxiv.1912.00544,
  title  = {Multi-Scale Self-Attention for Text Classification},
  author = {Qipeng Guo and Xipeng Qiu and Pengfei Liu and Xiangyang Xue and Zheng Zhang},
  journal= {arXiv preprint arXiv:1912.00544},
  year   = {2019}
}

备注

Accepted in AAAI2020