Transformer与生物医学背景知识的表示
计算与语言
2022-12-22 v3 人工智能
机器学习
摘要
基于Transformer的专用模型(如BioBERT和BioMegatron)根据公开可用的生物医学语料库针对生物医学领域进行了适配。因此,它们有潜力编码大规模生物学知识。我们研究了这些模型中对生物学知识的编码与表示,及其在支持癌症精准医疗推断中的潜在效用——即解读基因组改变的临床意义。我们比较了不同Transformer基线的性能;使用探测(probing)确定不同实体编码的一致性;并使用聚类方法比较和对比基因、变异、药物和疾病嵌入的内部属性。我们表明这些模型确实编码了生物学知识,尽管其中部分在针对特定任务的微调中丢失。最后,我们分析了模型对数据集中偏差与不平衡的行为。
引用
@article{arxiv.2202.02432,
title = {Transformers and the representation of biomedical background knowledge},
author = {Oskar Wysocki and Zili Zhou and Paul O'Regan and Deborah Ferreira and Magdalena Wysocka and Dónal Landers and André Freitas},
journal= {arXiv preprint arXiv:2202.02432},
year = {2022}
}
备注
25 pages, 12 figures, supplementary methods, tables and figures at the end of the manuscript