中文

利用大语言模型进行新型农药学命名实体识别:对比研究

计算与语言 2024-08-27 v1 信息检索

摘要

目标:探索和比较ChatGPT及其他最先进大语言模型(LLM)在针对新冠病毒文献的TCM领域内针对不同实体类型和领域的命名实体识别任务中的性能。方法:我们建立了一个包含389篇新冠病毒TCM文献的数据集,并手动标注了其中48篇文章,涵盖6种实体类型和3个领域作为基准,以评估LLM的命名实体识别性能。然后,我们使用ChatGPT(GPT-3.5和GPT-4)和4个基于BERT的问答(QA)模型(RoBERTa、MiniLM、PubMedBERT和SciBERT)进行6种实体类型的命名实体识别任务,这些模型在特定任务上没有事先训练。还应用一个领域微调模型(GSAP-NER)进行全面比较。结果:在精确匹配和模糊匹配方面,LLM的整体性能差异很大。在模糊匹配中,ChatGPT在5项任务中超过了基于BERT的QA模型;而在精确匹配中,基于BERT的QA模型在5项任务中超过了ChatGPT,但F-1分数差异较小。GPT-4在模糊匹配中尤其在TCM方剂和中文专利药(TFD)以及成分(IG)实体类型上显著优于其他模型。尽管GPT-4在草药、靶点和研究方法等实体类型上超过了基于BERT的模型,但没有任何F-1分数超过0.5。GSAP-NER在F-1指标上略胜于GPT-4于RM。ChatGPT在召回率方面显著高于精确率,尤其是在模糊匹配中。结论:大语言模型的命名实体识别性能高度依赖于实体类型,并且在不同应用场景中表现各异。ChatGPT可用于召回率优先的场景。然而,对于严谨场景下的知识获取,ChatGPT和基于BERT的QA模型都不是专业从业者的即插即用工具。

关键词

引用

@article{arxiv.2408.13501,
  title  = {Utilizing Large Language Models for Named Entity Recognition in Traditional Chinese Medicine against COVID-19 Literature: Comparative Study},
  author = {Xu Tong and Nina Smirnova and Sharmila Upadhyaya and Ran Yu and Jack H. Culbert and Chao Sun and Wolfgang Otto and Philipp Mayr},
  journal= {arXiv preprint arXiv:2408.13501},
  year   = {2024}
}

备注

22 pages with 2 figures