中文

基于私有微调大语言模型的患者医疗记录问答

计算与语言 2025-01-24 v1 人工智能

摘要

医疗系统不断生成大量的电子健康记录 (EHR),通常以 Fast Healthcare Interoperability Resources (FHIR) 标准存储。尽管这些记录包含丰富的信息,但其复杂性和庞大的volume使用户难以检索和解读关键健康洞察。近期大语言模型 (LLM) 的进展提供了解决方案,使能够对医疗数据进行语义问答 (QA),让用户能够更有效地与自己的健康记录交互。然而,确保隐私和合规性需要在边缘和私有部署中使用 LLM。本文提出了一种新方法,通过首先识别用户查询最相关的 FHIR 资源(任务1),然后基于这些资源回答查询(任务2)。我们评估了私有托管、微调后的 LLM 的性能,将其与基准模型如 GPT-4 和 GPT-4o 进行比较。我们的结果表明,微调后的 LLM 虽然规模是 GPT-4 系列模型的 1/250,但在任务1的 F1 分数上超过 GPT-4 系列模型 0.55%,在任务2的 Meteor 分数上提高 42%。此外,我们还考察了 LLM 的一些高级用法,包括顺序微调、模型自我评估(自恋式评估)以及训练数据规模对性能的影响。模型和数据集可在 https://huggingface.co/genloop 访问。

关键词

引用

@article{arxiv.2501.13687,
  title  = {Question Answering on Patient Medical Records with Private Fine-Tuned LLMs},
  author = {Sara Kothari and Ayush Gupta},
  journal= {arXiv preprint arXiv:2501.13687},
  year   = {2025}
}