中文

可解释语言模型在PubMedQA上的性能研究

计算与语言 2025-04-08 v1

摘要

大型语言模型(LLMs)在检索医学知识、对其进行推理以及回答医学问题方面已展现出与医生相当的显著能力。然而,这些模型不可解释、会产生幻觉、难以维护,并且在训练和推理时需要大量的计算资源。在本文中,我们报告了Gyan在PubmedQA数据集上的结果,Gyan是一种基于替代架构的可解释语言模型。Gyan LLM是一种组合式语言模型,且模型与知识解耦。Gyan是可信赖的、透明的,不产生幻觉,且不需要大量的训练或计算资源。Gyan可轻松跨领域迁移。Gyan-4.3在PubmedQA上取得了SOTA结果,准确率达到87.1%,相比之下,基于GPT-4的MedPrompt为82%,而Med-PaLM 2 (Google and DeepMind)为81.8%。我们未来将报告在其他医学数据集上的结果,包括MedQA、MedMCQA和MMLU - Medicine。

关键词

引用

@article{arxiv.2504.05074,
  title  = {On the Performance of an Explainable Language Model on PubMedQA},
  author = {Venkat Srinivasan and Vishaal Jatav and Anushka Chandrababu and Geetika Sharma},
  journal= {arXiv preprint arXiv:2504.05074},
  year   = {2025}
}

备注

Working Paper