SkIn:基于BERT的略读密集型长文本分类用于医学语料库
计算与语言
2022-09-27 v2 人工智能
摘要
BERT是自然语言处理中广泛使用的预训练模型。然而,由于BERT对文本长度呈二次复杂度,该模型难以直接用于长文本语料库。在某些领域,收集的文本数据可能相当长,例如医疗健康领域。因此,为将BERT的预训练语言知识应用于长文本,本文模仿人类阅读长段落时使用的略读密集型阅读方法,提出略读密集型模型(SkIn)。它能动态选择文本中的关键信息,从而显著缩短输入BERT-Base模型的句子,有效节省分类算法的开销。实验表明,SkIn方法在医学领域的长文本分类数据集上取得了优于基线的准确率,同时其时间和空间需求随文本长度线性增长,缓解了基础BERT在长文本数据上的时空溢出问题。
引用
@article{arxiv.2209.05741,
title = {SkIn: Skimming-Intensive Long-Text Classification Using BERT for Medical Corpus},
author = {Yufeng Zhao and Haiying Che},
journal= {arXiv preprint arXiv:2209.05741},
year = {2022}
}
备注
14 pages, 4 figures