中文

诊断AI外科决策支持中的幻觉风险:面向顺序验证的序列框架

机器学习 2025-11-21 v2 人工智能 计算机与社会

摘要

大型语言模型(LLMs)为脊柱外科临床决策提供变革性潜力,但通过幻觉(即事实不一致或情境错位的输出)带来显著风险,可能危及患者安全。本研究引入一种以临床医生为中心的框架,通过评估诊断精确度、recommendation quality、reasoning robustness、output coherence 和 knowledge alignment 来量化幻觉风险。我们对六个领先的 LLMs 在30个经专家验证的脊柱病例上进行评估。DeepSeek-R1 在总体性能上表现优异(总分:86.03 ±\pm 2.08),尤其在创伤和感染等高风险领域表现突出。关键发现表明,推理增强型模型变体并不总是优于标准版本:Claude-3.7-Sonnet 的扩展思考模式相对于其标准版本表现下降(80.79 ±\pm 1.83 vs. 81.56 ±\pm 1.92),表明仅靠扩展链式思考推理对于临床可靠性并不足够。多维度压力测试暴露了模型特定的脆弱性,其中在放大复杂性下,recommendation quality 降低 7.4%,而理性(+2.0%)、可读性(+1.7%)和诊断(+4.7%)仅有微小提升,凸显了感知上的连贯性与可操作性指导之间的担忧性差距。我们的发现主张将可解释性机制(如推理链可视化)整合到临床工作流程中,并为外科 LLM 部署建立了面向安全的验证框架。

关键词

引用

@article{arxiv.2511.00588,
  title  = {Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation},
  author = {Dong Chen and Yanzhe Wei and Zonglin He and Guan-Ming Kuang and Canhua Ye and Meiru An and Huili Peng and Yong Hu and Huiren Tao and Kenneth MC Cheung},
  journal= {arXiv preprint arXiv:2511.00588},
  year   = {2025}
}