重新审视基于Transformer的长文档分类模型
计算与语言
2022-10-26 v2
摘要
近期文本分类文献偏向于短文本序列(如句子或段落)。在真实应用中,多页多段落文档十分常见,而这类文档无法被原生Transformer模型高效编码。我们比较了不同的基于Transformer的长文档分类(TrLDC)方法,这些方法旨在缓解原生Transformer编码更长文本时的计算开销,即稀疏注意力与层次化编码方法。我们在涵盖不同领域的四个文档分类数据集上,考察了稀疏注意力(如局部注意力窗口大小、全局注意力的使用)与层次化(如文档切分策略)Transformer的若干方面。我们观察到能够处理更长文本带来的明显益处,并基于结果给出了在长文档分类任务上应用基于Transformer模型的实用建议。
引用
@article{arxiv.2204.06683,
title = {Revisiting Transformer-based Models for Long Document Classification},
author = {Xiang Dai and Ilias Chalkidis and Sune Darkner and Desmond Elliott},
journal= {arXiv preprint arXiv:2204.06683},
year = {2022}
}
备注
Findings of EMNLP 2022