CNN-Trans-Enc:基于静态 BERT 表征、在顶层使用 CNN 增强 Transformer 编码器的文档分类模型
计算与语言
2022-09-15 v1
摘要
BERT 在文本分类任务中取得了显著成果,但其尚未被充分利用,因为仅将最后一层用作下游分类器的表征输出。近期关于 BERT 所学语言特征本质的研究表明,不同层关注不同种类的语言特征。我们提出了一种 CNN 增强的 Transformer 编码器模型,该模型在来自所有层的固定 BERT 表征之上进行训练,采用卷积神经网络在 Transformer 编码器内部生成 QKV 特征图,而非将输入线性投影到嵌入空间。CNN-Trans-Enc 作为下游分类器相对较小,且不需要对 BERT 进行任何微调,因为它确保了对所有层 表征的最优利用,借助更具意义且可泛化的输入 QKV 表征来 leverage 不同的语言特征。将 BERT 与 CNN-Trans-Enc 结合,在 IMDB 和 SST-5 数据集上分别保持了当前最先进性能的 和 ,同时在 YELP-5 上以 ( 提升)取得新的最先进结果,在 Amazon-Polarity 上以 ( 提升)取得新的最先进结果(两个数据集各取 100 万样本子集的 K 折交叉验证)。在 AG news 数据集上,CNN-Trans-Enc 达到了当前最先进性能的 ,并在 DBPedia-14 上以平均准确率 取得新的顶尖性能。索引词:文本分类,自然语言处理,卷积神经网络,Transformers,BERT
引用
@article{arxiv.2209.06344,
title = {CNN-Trans-Enc: A CNN-Enhanced Transformer-Encoder On Top Of Static BERT representations for Document Classification},
author = {Charaf Eddine Benarab and Shenglin Gui},
journal= {arXiv preprint arXiv:2209.06344},
year = {2022}
}