探究语言模型中的生物医学嵌入表示
计算与语言
2019-04-05 v1
摘要
从预训练语言模型(LMs)得到的上下文词嵌入在下游 NLP 任务上展现出显著改进。在特定领域语料(如生物医学文献)上预训练可进一步提升其性能。本文中,我们开展探测实验,以确定经领域内训练的上下文嵌入本身携带了哪些额外信息。为此,我们将预训练 LMs 用作固定特征提取器,并限制下游任务模型不具有额外的序列建模层。我们比较了 BERT、ELMo、BioBERT 以及 BioELMo(在 1000 万篇 PubMed 摘要上训练的 ELMo 生物医学版本)。令人惊讶的是,尽管微调后的 BioBERT 在生物医学 NER 与 NLI 任务上优于 BioELMo,但作为固定特征提取器,BioELMo 在我们的探测任务中表现优于 BioBERT。我们利用可视化与最近邻分析表明,对实体类型与关系信息的更好编码导致了这一优势。
引用
@article{arxiv.1904.02181,
title = {Probing Biomedical Embeddings from Language Models},
author = {Qiao Jin and Bhuwan Dhingra and William W. Cohen and Xinghua Lu},
journal= {arXiv preprint arXiv:1904.02181},
year = {2019}
}
备注
NAACL-HLT 2019 Workshop on Evaluating Vector Space Representations for NLP (RepEval)