中文

PathologyBERT——预训练与面向病理学领域的新Transformer语言模型之比较

计算与语言 2022-05-17 v1

摘要

鉴于报告差异性和癌症亚型定义中不断出现的新发现,病理学文本挖掘是一项具有挑战性的任务。然而,对大型病理学数据库的成功文本挖掘可在推进“大数据”癌症研究(如基于相似性的治疗选择、病例识别、预后判断、监测、临床试验筛选、风险分层等)方面发挥关键作用。尽管在开发更特定临床领域的语言模型方面兴趣日益增长,但目前尚无支持病理学空间内快速数据挖掘开发的病理学专用语言空间。文献中已有少数方法在专用语料上微调通用transformer模型同时保留原始分词器,但在需要专业术语的领域,这些模型往往表现不足。我们提出PathologyBERT——一个在347,173份组织病理学标本报告上预训练的掩码语言模型,并已发布于Huggingface仓库。我们的综合实验表明,与非特异性语言模型相比,在病理学语料上预训练transformer模型可提升自然语言理解(NLU)和乳腺癌诊断分类的性能。

关键词

引用

@article{arxiv.2205.06885,
  title  = {PathologyBERT -- Pre-trained Vs. A New Transformer Language Model for Pathology Domain},
  author = {Thiago Santos and Amara Tariq and Susmita Das and Kavyasree Vayalpati and Geoffrey H. Smith and Hari Trivedi and Imon Banerjee},
  journal= {arXiv preprint arXiv:2205.06885},
  year   = {2022}
}

备注

submitted to "American Medical Informatics Association (AMIA)" 2022 Annual Symposium