中文

语言模型能否识别乳腿癌放疗的副作用?

计算与语言 2026-05-19 v2

摘要

准确地向癌症幸存者传达治疗副作用至关重要,尤其是在知情同意情境下,医生必须清晰、全面地传达潜在治疗毒性。然而,这一任务仍具有挑战性,主要源于对不良治疗效应的临床知识不足以及电子健康记录 (EHR) 系统中的信息碎片化。大型语言模型 (LLM) 有望在此任务中提供帮助,尽管其在肿瘤学幸存护理背景下的可靠性尚未得到充分了解。我们构建了一个面向部署的压力测试框架,用于评估 LLM 生成的乳腿癌放疗副作用列表。我们使用 21 例乳腿癌患者档案构建了配对患者临床情景,这些情景仅在放疗方案上存在差异,以评估七个经过指令微调的 LLM 在多种提示方案下的表现。随后,我们将 LLM 输出与由两家主要学术医学中心的临床医生精选参考标准进行比较,该参考标准由七位以上乳腿放射科医生开发,映射放疗剂量-分层、场部和部位到相关毒性,按发生频率和发生时间细分。在所有模型中,我们揭示了对微小文档变更的敏感性、精确率与召回率之间的权衡,以及系统性低召回稀有和长期副作用的现象。就单独使用时而言,限制生成副作用数量会降低精确率, grounding 输出于临床医生精选副作用列表可显著提高可靠性和鲁棒性。这些发现凸显了 LLM 在肿瘤学中的重要局限,指导更安全更具信息性的幸存护理应用的实用设计选择。

关键词

引用

@article{arxiv.2605.08439,
  title  = {Can Language Models Identify Side Effects of Breast Cancer Radiation Treatments?},
  author = {Natalie Seah and Danielle S. Bitterman and Daphna Spiegel and Thomas Hartvigsen},
  journal= {arXiv preprint arXiv:2605.08439},
  year   = {2026}
}