面向长文档分类的长度感知多核变换器
计算与语言
2024-05-14 v1
摘要
长度较长的文档因大量内存消耗而给神经语言模型带来独特挑战。虽然现有最先进(SOTA)模型将长文本分割为等长片段(例如每 128 个标记的片段)或部署稀疏注意力网络,但这些方法由于句子边界和不同文本长度,面临上下文碎片化和通用性新挑战。例如,我们的经验分析表明,SOTA模型在一致地过拟合一组长度较长的文档(例如 2000 个标记)时,反而在其他长度的文本(例如 1000 或 4000)上的表现更差。在本研究中,我们提出了长度感知多核变换器(Length-Aware Multi-Kernel Transformer, 简称LAMKIT)以解决长文档分类的新挑战。LAMKIT通过多样化的基于变换器的核方法编码长文档,以桥接上下文边界,并通过核方法将文本长度向量化,以促进模型对不同文档长度的鲁棒性。在来自健康和法律领域的五个标准基准数据集上的实验表明,LAMKIT相较于SOTA模型在性能上提升了最高可达 10.9%。我们进行了大量消融分析,以检验模型在不同文档长度下的鲁棒性和有效性。
引用
@article{arxiv.2405.07052,
title = {Length-Aware Multi-Kernel Transformer for Long Document Classification},
author = {Guangzeng Han and Jack Tsao and Xiaolei Huang},
journal= {arXiv preprint arXiv:2405.07052},
year = {2024}
}
备注
Accepted to SEM 2024