辅助生殖技术中大语言模型生成临床推理的可靠性:盲法比较评估研究
人工智能
2025-10-21 v1
摘要
高质量临床链式思维(CoT)的创建对于可解释的医学人工智能(AI)至关重要,但受限于数据稀缺。尽管大型语言模型(LLMs)能够综合医学数据,但其临床可靠性尚未获准确认。本研究评估了大语言模型生成 CoT 的可靠性,并探讨了改善其质量的提示策略。在盲法比较研究中,辅助生殖技术(ART)的资深临床医生评估了通过三种不同策略生成的 CoT:零-shot、随机 few-shot(使用浅层示例)和选择性 few-shot(使用多样且高质量的示例)。这些专家评分与来自最先进 AI 模型(GPT-4o)的评估进行了比较。选择性 few-shot 策略在所有人类评估指标上均显著优于其他策略(p < .001)。关键的是,随机 few-shot 策略未显著优于零-shot 基线,表明低质量的示例与没有示例一样无效。选择性策略的成功归因于两个原则:“黄金标准深度”(推理质量)和“代表性多样性”(泛化)。值得注意的是,AI 评估器未能辨别出这些关键性能差异。合成 CoT 的临床可靠性由战略性提示 curated 决定,而非示例的简单存在。我们提出了“双原则”框架作为大规模可信数据生成的基础方法。这项工作提供了经过验证的解决方案,缓解了数据瓶颈,并确认了人类专业知识在评估高风险临床 AI 中的必不可少作用。
引用
@article{arxiv.2510.16095,
title = {Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study},
author = {Dou Liu and Ying Long and Sophia Zuoqiu and Di Liu and Kang Li and Yiting Lin and Hanyi Liu and Rong Yin and Tian Tang},
journal= {arXiv preprint arXiv:2510.16095},
year = {2025}
}