用于文本分类的多尺度自注意力
计算与语言
2019-12-03 v1 机器学习
摘要
在本文中,我们将先验知识——多尺度结构——引入自注意力模块。我们提出了一种多尺度 Transformer,它使用多尺度多头自注意力来从不同尺度捕获特征。基于语言学视角以及对预训练 Transformer(BERT)在大型语料库上的分析,我们进一步设计了一种策略来控制每一层的尺度分布。三类不同任务(21 个数据集)的结果表明,我们的多尺度 Transformer 在中小规模数据集上持续且显著优于标准 Transformer。
引用
@article{arxiv.1912.00544,
title = {Multi-Scale Self-Attention for Text Classification},
author = {Qipeng Guo and Xipeng Qiu and Pengfei Liu and Xiangyang Xue and Zheng Zhang},
journal= {arXiv preprint arXiv:1912.00544},
year = {2019}
}
备注
Accepted in AAAI2020