中文

LLM推理中的认知偏差妨碍临床肿瘤学笔记的解读

计算与语言 2025-11-27 v1 人工智能

摘要

尽管大型语言模型在临床基准测试中表现出高准确率,但它们可能通过错误的推理方式得出正确结论,这是一种未被准确率为主的评估所捕获的失败模式,对肿瘤学决策支持具有安全隐患。本研究进行了双队列回顾性研究,我们开发了从GPT-4链式思维响应中提取的推理错误的分层分类法,并测试其临床相关性。我们对600个推理痕迹进行标注,以定义三个层次的分类,将计算失败映射到认知偏差框架。我们在822个来自乳腺癌和胰腺癌就诊记录的CORAL数据集中的响应上验证了该分类法,模拟了提取、分析和临床建议任务。推理错误发生在23%的解释中,并主导整体错误,确认偏差和锚定偏差最为常见。推理失败与指南不符和可能有害的建议相关,特别是在advanced disease管理中。使用最先进的语言模型的自动评估器检测到错误的存在,但无法可靠地分类子类型。这些发现表明,大型语言模型可能在推理错误时提供流畅但临床上不安全的建议。该分类法提供了一个可通用的框架,用于在临床部署前评估和改进推理忠诚度。

关键词

引用

@article{arxiv.2511.20680,
  title  = {Cognitive bias in LLM reasoning compromises interpretation of clinical oncology notes},
  author = {Matthew W. Kenaston and Umair Ayub and Mihir Parmar and Muhammad Umair Anjum and Syed Arsalan Ahmed Naqvi and Priya Kumar and Samarth Rawal and Aadel A. Chaudhuri and Yousef Zakharia and Elizabeth I. Heath and Tanios S. Bekaii-Saab and Cui Tao and Eliezer M. Van Allen and Ben Zhou and YooJung Choi and Chitta Baral and Irbaz Bin Riaz},
  journal= {arXiv preprint arXiv:2511.20680},
  year   = {2025}
}

备注

24 pages, 6 figures, 1 supplementary figure, 3 tables