中文

面向中文生物医学实体归一化的知识注入提示学习

计算与语言 2023-08-24 v1

摘要

生物医学实体归一化(BEN)任务旨在将原始、非结构化的医学实体对齐到标准实体,从而促进数据一致性并便于更好的下游医学应用。近来,提示学习方法在该任务中展现出有前景的结果。然而,现有研究难以应对更为复杂的中文 BEN 任务,尤其在医学数据有限的少样本场景下,且外部医学知识库的巨大潜力尚未被充分挖掘。为应对这些挑战,我们提出了一种新颖的知识注入提示学习(PL-Knowledge)方法。具体而言,我们的方法包含五个阶段:候选实体匹配、知识抽取、知识编码、知识注入与预测输出。通过有效编码医学实体所含知识项并将其融入我们量身定制的知识注入模板,额外知识增强了模型捕捉医学实体间潜在关联的能力,从而实现对标准实体的更好匹配。我们在基准数据集上于少样本与全量两种场景中对模型进行了充分评估。我们的方法优于现有基线,少样本下平均准确率提升 12.96%,全量数据下提升 0.94%,展现了其在 BEN 任务中的优越性。

关键词

引用

@article{arxiv.2308.12025,
  title  = {Knowledge-injected Prompt Learning for Chinese Biomedical Entity Normalization},
  author = {Songhua Yang and Chenghao Zhang and Hongfei Xu and Yuxiang Jia},
  journal= {arXiv preprint arXiv:2308.12025},
  year   = {2023}
}