中文

近期大语言模型在生成肺癌患者医院出院总结方面的比较研究

计算与语言 2024-11-07 v1

摘要

生成出院总结是临床实践中至关重要但耗时的任务,对于传递患者相关信息、促进医疗连续性至关重要。大语言模型(LLM)的最新进展显著增强了其理解和总结复杂医学文本的能力。本研究旨在探索LLM如何减轻手动总结的负担、提高工作流程效率并支持医疗环境中的知情决策。使用了来自1,099名肺癌患者队列的临床记录,其中50名患者用于测试,102名患者用于模型微调。本研究评估了多种LLM(包括GPT-3.5、GPT-4、GPT-4o和LLaMA 3 8b)在生成出院总结方面的性能。评估指标包括标记级分析(BLEU、ROUGE-1、ROUGE-2、ROUGE-L)以及模型生成摘要与医生撰写的金标准之间的语义相似度分数。对LLaMA 3 8b进一步在不同长度的临床记录上进行了测试,以检验其性能的稳定性。研究发现LLM之间的总结能力存在显著差异。GPT-4o和微调后的LLaMA 3在标记级评估指标上表现优异,而LLaMA 3在不同输入长度下始终生成简洁的摘要。语义相似度分数表明GPT-4o和LLaMA 3是捕获临床相关性的领先模型。本研究为LLM在生成出院总结方面的有效性提供了见解,突出了LLaMA 3在保持不同临床情境下清晰性和相关性方面的稳健性能。这些发现强调了自动总结工具在提高文档精确性和效率方面的潜力,最终改善患者护理和医疗机构的运营能力。

关键词

引用

@article{arxiv.2411.03806,
  title  = {Understanding the Effects of Human-written Paraphrases in LLM-generated Text Detection},
  author = {Hiu Ting Lau and Arkaitz Zubiaga},
  journal= {arXiv preprint arXiv:2411.03806},
  year   = {2024}
}