中文

利用检索增强语言模型提升 GPT-3/4 在生物医学数据上的结果准确性

计算与语言 2024-08-27 v2 人工智能

摘要

大语言模型(LLMs)在自然语言处理(NLP)方面取得了显著进展。宽泛语料库能捕捉多样模式但可能引入不相关信息,而聚焦语料库通过减少误导性信息来提高可靠性。在聚焦语料库上训练 LLM 存在计算挑战。一种替代方案是使用在特定领域中测试过的检索增强(RetA)方法。为评估 LLM 性能,我们使用关于弥漫大 B 细胞淋巴瘤(DLBCL)疾病的 19 个问题,对 OpenAI 的 GPT-3、GPT-4、Bing 的 Prometheus 以及一个定制 RetA 模型进行了比较。八位独立评审员根据准确性、相关性和可读性(评分为 1-3)对回答进行评估。RetA 模型在准确性(19 项中有 12 项获 3 分,总分=47)和相关性(19 项中有 13 项,50 分)上表现最佳,其次是 GPT-4(8/19,43 分;11/19,49 分)。GPT-4 获得最高的可读性分数(17/19,55 分),其次是 GPT-3(15/19,53 分)和 RetA 模型(11/19,47 分)。Prometheus 在准确性(34)、相关性(32)和可读性(38)上表现不佳。与 RetA 模型和 Prometheus 相比,GPT-3.5 和 GPT-4 在所有 19 个回答中产生了更多幻觉。幻觉大多与不存在的参考文献或虚构的疗效数据有关。这些发现表明,辅以领域特定语料库的 RetA 模型在特定领域的准确性和相关性上可能优于通用 LLM。然而,该评估仅限于特定问题和指标,可能无法涵盖语义搜索和其他 NLP 任务中的挑战。进一步的研究将探索不同的 LLM 架构、RetA 方法和评估方法,以更全面地评估其优势与局限。

关键词

引用

@article{arxiv.2305.17116,
  title  = {Improving accuracy of GPT-3/4 results on biomedical data using a retrieval-augmented language model},
  author = {David Soong and Sriram Sridhar and Han Si and Jan-Samuel Wagner and Ana Caroline Costa Sá and Christina Y Yu and Kubra Karagoz and Meijian Guan and Hisham Hamadeh and Brandon W Higgs},
  journal= {arXiv preprint arXiv:2305.17116},
  year   = {2024}
}