中文

大型语言模型在胃肠病学中的自报告置信度:商业、开源与量化模型的分析

计算与语言 2026-04-10 v1 人工智能 人机交互 机器学习

摘要

本研究使用 300 道胃肠病学委员会风格的问题,评估了多个大型语言模型(GPT、Claude、Llama、Phi、Mistral、Gemini、Gemma 和 Qwen)的自报告响应确定性。表现最高的模型(GPT-o1 preview、GPT-4o 和 Claude-3.5-Sonnet)取得了 0.15-0.2 的 Brier 分数和 0.6 的 AUROC。尽管较新的模型表现出更好的性能,但所有模型都表现出一致的过度自信倾向。不确定性估计对 LLM 在医疗保健中的安全使用构成了重大挑战。关键词:大型语言模型;置信度引导;人工智能;胃肠病学;不确定性量化

关键词

引用

@article{arxiv.2503.18562,
  title  = {Self-Reported Confidence of Large Language Models in Gastroenterology: Analysis of Commercial, Open-Source, and Quantized Models},
  author = {Nariman Naderi and Seyed Amir Ahmad Safavi-Naini and Thomas Savage and Zahra Atf and Peter Lewis and Girish Nadkarni and Ali Soroush},
  journal= {arXiv preprint arXiv:2503.18562},
  year   = {2026}
}

备注

35 pages, 5 figures, 1 table, 7 supplementary figures