中文

探索大语言模型在医疗保健领域的应用:关于语料库来源、定制策略与评估指标的洞见

计算与语言 2025-02-18 v1

摘要

本研究综述了大语言模型(LLMs)在医疗保健领域的应用,重点关注其训练语料库、定制技术和评估指标。通过系统检索2021至2024年间的研究文献,共识别出61篇文章。语料库类型包括临床资源、文献、开源数据集和网页抓取数据。常见的构建技术包括预训练、提示工程和检索增强生成,其中44项研究结合了多种方法。评估指标被归类为过程指标、可用性指标和结果指标,其中结果指标进一步分为模型指标和专家评估结果。该研究确定了语料库公平性的关键缺口,这些缺口导致了来自地理、文化和社会经济因素的偏见。对未经验证或非结构化数据的依赖凸显了更好整合基于证据的临床指南的必要性。未来的研究应聚焦于开发具有分层结构的语料库架构,采用经审核的来源并实现动态加权,同时确保模型的透明度。此外,缺乏针对特定领域模型的标准化评估框架,呼吁在真实世界医疗环境中对LLMs进行全面验证。

关键词

引用

@article{arxiv.2502.11861,
  title  = {Exploring Large Language Models in Healthcare: Insights into Corpora Sources, Customization Strategies, and Evaluation Metrics},
  author = {Shuqi Yang and Mingrui Jing and Shuai Wang and Jiaxin Kou and Manfei Shi and Weijie Xing and Yan Hu and Zheng Zhu},
  journal= {arXiv preprint arXiv:2502.11861},
  year   = {2025}
}

备注

45 pages, 1 figure, 5 tables