中文

面向生物医学问答的无监督预训练

计算与语言 2020-09-29 v1

摘要

我们探讨了无监督表示学习方法(BioBERT、SciBERT 与 BioSentVec)在生物医学文本上对于生物医学问答的适用性。为了进一步改进生物医学问答的无监督表示,我们引入了一项基于无标签数据的新预训练任务,旨在对上下文中生物医学实体进行推理。我们的预训练方法通过将给定上下文中的某些生物医学实体提及随机替换为随机实体提及来破坏上下文,然后以正确实体提及查询模型以定位上下文中被破坏的部分。这一去噪任务使模型能够从丰富的无标签生物医学文本中学习良好的表示,从而有助于问答任务,并通过要求模型预测跨度,最小化预训练任务与下游问答任务之间的训练-测试失配。我们的实验表明,在所提出的预训练任务上对 BioBERT 进行预训练显著提升了性能,并优于第 7 届 BioASQ Task 7b-Phase B 挑战赛此前的最佳模型。

关键词

引用

@article{arxiv.2009.12952,
  title  = {Unsupervised Pre-training for Biomedical Question Answering},
  author = {Vaishnavi Kommaraju and Karthick Gunasekaran and Kun Li and Trapit Bansal and Andrew McCallum and Ivana Williams and Ana-Maria Istrate},
  journal= {arXiv preprint arXiv:2009.12952},
  year   = {2020}
}

备注

To appear in BioASQ workshop 2020