中文

大型语言模型在放射科报告摘要中的当前应用状态

计算与语言 2025-04-07 v1

摘要

大型语言模型(LLM)如ChatGPT在各种自然语言处理任务中展现出卓越的文本生成能力,尤其在放射科报告摘要的应用效果尚不明确。本研究探索了八种LLM在放射科报告摘要生成中的能力。从北京大学癌症医院与研究所收集了三类放射科报告,即CT、PET-CT和超声报告。我们利用报告发现构建零样本、单样本和三样本提示,并使用完整示例报告生成摘要。除了自动量化评估指标外,我们定义五个人类评估指标,即完整性、正确性、简洁性、可信度和可替代性,用于评估生成摘要的语义。两位胸外科医生(ZSY、LB)和一位放射科医生(LQ)对比生成摘要与参考摘要,在五个指标下对每个摘要进行评分。实验结果表明,生成的摘要与参考摘要之间存在差距。尽管LLM在完整性和正确性方面表现相当,但简洁性和可信度得分不高。使用少样本提示可提高LLM在简洁性和可信度方面的表现,但临床医生仍认为LLM无法取代放射科医生来总结放射科报告摘要。

关键词

引用

@article{arxiv.2406.02134,
  title  = {The current status of large language models in summarizing radiology report impressions},
  author = {Danqing Hu and Shanyuan Zhang and Qing Liu and Xiaofeng Zhu and Bing Liu},
  journal= {arXiv preprint arXiv:2406.02134},
  year   = {2025}
}