中文

链式思考何时适得其反:评估医学语言模型的提示敏感性

计算与语言 2026-03-30 v1 人工智能

摘要

大型语言模型(LLM)越来越多地被部署在医疗环境中,但其对提示格式的敏感性仍未得到良好描述。我们评估了 MedGemma(4B 和 27B 参数)在 MedMCQA(4,183 个问题)和 PubMedQA(1,000 个问题)上的表现,进行了广泛的鲁棒性测试。我们的实验揭示了几个令人担忧的发现。链式思考(CoT)提示相对于直接回答将准确率降低 5.7%。少量样本会降低性能 11.9%,同时将位置偏差从 0.14 增加到 0.47。随机化答案选项会导致模型 59.1% 的时间改变预测,准确率下降最高可达 27.4 个百分点。将前置上下文截断至 50% 导致准确率跌破无上下文基准,而后截断可保留 97% 的完整上下文准确率。我们进一步表明,cloze 评分(选择最高概率选项标记)在 4B 模型上达到 51.8%,27B 模型上达到 64.5%,超过所有提示策略,表明模型“知道”的比其生成的文本更丰富。置换投票比单一顺序推理恢复 4 个百分点。这些结果表明,经过验证的通用模型提示工程技术并不适用于特定医学领域的 LLM,而可靠的替代方法已存在。

关键词

引用

@article{arxiv.2603.25960,
  title  = {When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models},
  author = {Binesh Sadanandan and Vahid Behzadan},
  journal= {arXiv preprint arXiv:2603.25960},
  year   = {2026}
}