中文

EPICURE:用于从文献中抽取癌症突变的集成预训练模型

计算与语言 2021-06-16 v1 人工智能

摘要

为了解读患者样本中的基因谱,有必要了解哪些突变在相应癌症类型的发展中起重要作用。命名实体识别是文本挖掘流程中的核心步骤,有助于从科学文献中挖掘有价值的癌症信息。然而,由于相关数据集的稀缺,该领域以往的命名实体识别尝试要么在部署基于深度学习的模型时性能较低,要么采用基于特征的机器学习模型或基于规则的模型来解决此问题,这需要领域专家的密集投入,并限制了模型的泛化能力。在本文中,我们提出 EPICURE,一种配备条件随机场模式层与跨度预测模式层的集成预训练模型,用于从文本中抽取癌症突变。我们还采用数据增强策略从多个数据集扩展训练集。在三个基准数据集上的实验结果表明,与基线模型相比具有竞争力。

关键词

引用

@article{arxiv.2106.07722,
  title  = {EPICURE Ensemble Pretrained Models for Extracting Cancer Mutations from Literature},
  author = {Jiarun Cao and Elke M van Veen and Niels Peek and Andrew G Renehan and Sophia Ananiadou},
  journal= {arXiv preprint arXiv:2106.07722},
  year   = {2021}
}