中文

评估大型语言模型在放射治疗 CT 模拟订单自动摘要生成中的性能

医学物理 2025-11-11 v1 人工智能

摘要

目的:本研究旨在使用大型语言模型(LLM)自动从 CT 模拟订单生成摘要,并评估其性能。材料与方法:收集了本机构 Aria 数据库中的 607 例 CT 模拟订单。使用通过应用程序编程接口(API)服务访问的本地托管 Llama 3.1 405B 模型,用于从 CT 模拟订单中提取关键词并生成摘要。将下载的 CT 模拟订单根据治疗模式和疾病部位分为七个组。针对每个组,开发了针对该组的定制指令提示词,由治疗师共同开发,以指导 Llama 3.1 405B 模型生成摘要。对应摘要的ground truth 通过仔细审查每个 CT 模拟订单并经治疗师验证后得出。使用经验证的ground truth 作为参考,对 LLM 生成的摘要准确性进行治疗师评估。结果:约 98% 的 LLM 生成的摘要在准确性方面与手动生成的ground truth 一致。我们的评估显示,LLM 生成的摘要在格式一致性和可读性方面都优于相应的治疗师生成摘要。该自动方法在所有组中表现一致,无论是模态还是疾病部位。结论:本研究表明 Llama 3.1 405B 模型在提取关键词和生成 CT 模拟订单摘要方面具有高精度和一致性,表明大型语言模型在完成此任务方面具有巨大的潜力,能够减轻治疗师的工作负担并提高工作流程效率。

关键词

引用

@article{arxiv.2501.16309,
  title  = {Evaluating The Performance of Using Large Language Models to Automate Summarization of CT Simulation Orders in Radiation Oncology},
  author = {Meiyun Cao and Shaw Hu and Jason Sharp and Edward Clouser and Jason Holmes and Linda L. Lam and Xiaoning Ding and Diego Santos Toesca and Wendy S. Lindholm and Samir H. Patel and Sujay A. Vora and Peilong Wang and Wei Liu},
  journal= {arXiv preprint arXiv:2501.16309},
  year   = {2025}
}