中文

语言模型能否作为生物医学知识库?

计算与语言 2021-09-16 v1

摘要

预训练语言模型(LM)已无处不在,被用于解决各类自然语言处理(NLP)任务。人们愈发关注这些 LM 所含的知识以及我们如何提取这些知识,将 LM 视为知识库(KB)。尽管已有大量关于通用领域 LM 探测的工作,但鲜有注意力投向这些强大的 LM 能否用作特定领域 KB。为此,我们创建了 BioLAMA 基准,其由 49K 条用于探测生物医学 LM 的生物医学事实知识三元组构成。我们发现,采用近期提出的探测方法,生物医学 LM 在检索生物医学知识上可达到最高 18.51% 的 Acc@5。尽管鉴于任务难度这看似前景可期,我们的详细分析揭示多数预测与不含任何主体的提示模板高度相关,从而在每个关系上产生相似结果,阻碍其作为特定领域 KB 的能力。我们希望 BioLAMA 能作为生物医学事实探测的一项具挑战性基准。

关键词

引用

@article{arxiv.2109.07154,
  title  = {Can Language Models be Biomedical Knowledge Bases?},
  author = {Mujeen Sung and Jinhyuk Lee and Sean Yi and Minji Jeon and Sungdong Kim and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2109.07154},
  year   = {2021}
}

备注

EMNLP 2021. Code available at https://github.com/dmis-lab/BioLAMA