中文

大语言模型在 CONSORT 检查表上的认知能力评估:多维度分析

人工智能 2026-02-26 v3 计算与语言

摘要

尽管大语言模型(LLM)在医疗领域快速扩展,但对其评估临床试验报告按 CONSORT 标准能力的鲁健性和可解释性仍是开放挑战。特别是,LLM 推理的不确定性校准和元认知可靠性在医学自动化中仍不明确且未被充分探索。本研究采用行为和元认知分析方法,使用经专家验证的数据集,系统比较两种代表性 LLM——一种通用型、一种领域专化型——在三种提示策略下的表现。我们分析了两种认知适应性和校准误差,包括预期校准误差(ECE)和基准归一化相对校准误差(RCE),后者使跨模型比较可靠。我们的结果显示,两种模型在临床角色扮演条件下都表现出显著的误校准和过度自信,校准误差始终高于临床相关阈值。这些发现凸显了需要改进校准、透明代码以及战略性提示工程,以开发可靠且可解释的医学 AI 的必要性。

关键词

引用

@article{arxiv.2510.19139,
  title  = {A Multi-faceted Analysis of Cognitive Abilities: Evaluating Prompt Methods with Large Language Models on the CONSORT Checklist},
  author = {Sohyeon Jeon and Hyung-Chul Lee},
  journal= {arXiv preprint arXiv:2510.19139},
  year   = {2026}
}

备注

We have decided to withdraw this manuscript because we believe it requires further revision and substantial improvement before it is suitable for dissemination to the academic community