中文

基于 BERT 与文本到文本方法的 PubMed 文章化学物质识别与索引

计算与语言 2021-12-01 v1

摘要

Biocreative VII Track-2 挑战赛包含命名实体识别、实体链接(或实体归一化)和主题索引任务——本挑战中实体和主题仅限于化学物质。命名实体识别是一个成熟的问题,我们使用基于 BERT 的 BioMegatron 模型取得了最佳性能。我们将基于 BERT 的方法扩展到实体链接任务。在使用称为自对齐预训练 (SAP) 的度量学习损失策略对 BioBERT 进行第二阶段预训练后,我们基于其 SAP-BioBERT 词嵌入之间的余弦相似度来链接实体。尽管我们的命名实体识别实验取得了成功,但我们发现化学索引任务通常更具挑战性。除了传统的 NER 方法外,我们还尝试使用一种新颖的基于文本到文本或“提示”的方法来进行命名实体识别和实体链接,该方法使用诸如 T5 和 GPT 等生成式语言模型。我们使用这种新方法取得了令人鼓舞的结果。

关键词

引用

@article{arxiv.2111.15622,
  title  = {Chemical Identification and Indexing in PubMed Articles via BERT and Text-to-Text Approaches},
  author = {Virginia Adams and Hoo-Chang Shin and Carol Anderson and Bo Liu and Anas Abidin},
  journal= {arXiv preprint arXiv:2111.15622},
  year   = {2021}
}

备注

Submission to the BioCreative VII challenge - Track-2