中文

SkIn:基于BERT的略读密集型长文本分类用于医学语料库

计算与语言 2022-09-27 v2 人工智能

摘要

BERT是自然语言处理中广泛使用的预训练模型。然而,由于BERT对文本长度呈二次复杂度,该模型难以直接用于长文本语料库。在某些领域,收集的文本数据可能相当长,例如医疗健康领域。因此,为将BERT的预训练语言知识应用于长文本,本文模仿人类阅读长段落时使用的略读密集型阅读方法,提出略读密集型模型(SkIn)。它能动态选择文本中的关键信息,从而显著缩短输入BERT-Base模型的句子,有效节省分类算法的开销。实验表明,SkIn方法在医学领域的长文本分类数据集上取得了优于基线的准确率,同时其时间和空间需求随文本长度线性增长,缓解了基础BERT在长文本数据上的时空溢出问题。

关键词

引用

@article{arxiv.2209.05741,
  title  = {SkIn: Skimming-Intensive Long-Text Classification Using BERT for Medical Corpus},
  author = {Yufeng Zhao and Haiying Che},
  journal= {arXiv preprint arXiv:2209.05741},
  year   = {2022}
}

备注

14 pages, 4 figures