用于长文档分类的分层 Transformer
计算与语言
2019-10-25 v1 机器学习
机器学习
摘要
BERT(Bidirectional Encoder Representations from Transformers,基于 Transformer 的双向编码器表示)是最近基于迁移学习范式引入的语言表示模型。我们扩展其微调过程以解决其主要局限之一——对长于数百词(如人类通话记录转录文本)的输入适用性。我们的方法在概念上很简单。我们将输入分割为更小的块,并将每块送入基模型。然后,我们将每个输出通过一个单一的循环层或另一个 transformer,随后接 softmax 激活。我们在消费完最后一段后获得最终分类决策。我们展示了两种 BERT 扩展均能快速微调,并在小规模特定领域数据集上仅训练 1 个 epoch 后即收敛。我们将其成功应用于涉及客户通话满意度预测与主题分类的三个不同任务,并在其中两个任务上相较基线模型获得显著提升。
引用
@article{arxiv.1910.10781,
title = {Hierarchical Transformers for Long Document Classification},
author = {Raghavendra Pappagari and Piotr Żelasko and Jesús Villalba and Yishay Carmiel and Najim Dehak},
journal= {arXiv preprint arXiv:1910.10781},
year = {2019}
}
备注
4 figures, 7 pages