从知识生成到知识验证:检验 ChatGPT 生物医学生成能力
人工智能
2025-03-25 v2 计算与语言
信息检索
摘要
大型语言模型的生成能力为加速任务提供了机会,但也引发对所产生知识真实性的担忧。为解决这些担忧,我们提出了一种计算方法,用于评估由大型语言模型生成的生物医学知识的事实准确性。我们的 метод consist 由两个过程组成:生成以疾病为中心的关联,并使用生物医学本体的语义框架对这些关联进行验证。选定 ChatGPT 作为研究中使用的大型语言模型,我们设计了提示工程过程,以建立疾病与相关药物、症状和基因之间的关联,并评估了不同 ChatGPT 模型(如 GPT-turbo、GPT-4 等)之间的一致性。实验结果显示,在识别疾病术语(88%-97%)、药物名称(90%-91%)和基因信息(88%-98%)方面准确率很高。然而,症状术语的识别率明显较低(49%-61%),因为症状描述的非正式且冗长的特性,阻碍了与专门本体正式语言的有效语义匹配。关联的验证显示,疾病-药物和疾病-基因对的文献覆盖率为 89%-91%,而症状相关关联的覆盖率较低(49%-62%)。
引用
@article{arxiv.2502.14714,
title = {From Knowledge Generation to Knowledge Verification: Examining the BioMedical Generative Capabilities of ChatGPT},
author = {Ahmed Abdeen Hamed and Alessandro Crimi and Magdalena M. Misiak and Byung Suk Lee},
journal= {arXiv preprint arXiv:2502.14714},
year = {2025}
}
备注
28 pages, 6 figures, In Review with a Cell Press Journal