大型语言模型在胃肠病学中的自报告置信度:商业、开源与量化模型的分析
计算与语言
2026-04-10 v1 人工智能
人机交互
机器学习
摘要
本研究使用 300 道胃肠病学委员会风格的问题,评估了多个大型语言模型(GPT、Claude、Llama、Phi、Mistral、Gemini、Gemma 和 Qwen)的自报告响应确定性。表现最高的模型(GPT-o1 preview、GPT-4o 和 Claude-3.5-Sonnet)取得了 0.15-0.2 的 Brier 分数和 0.6 的 AUROC。尽管较新的模型表现出更好的性能,但所有模型都表现出一致的过度自信倾向。不确定性估计对 LLM 在医疗保健中的安全使用构成了重大挑战。关键词:大型语言模型;置信度引导;人工智能;胃肠病学;不确定性量化
引用
@article{arxiv.2503.18562,
title = {Self-Reported Confidence of Large Language Models in Gastroenterology: Analysis of Commercial, Open-Source, and Quantized Models},
author = {Nariman Naderi and Seyed Amir Ahmad Safavi-Naini and Thomas Savage and Zahra Atf and Peter Lewis and Girish Nadkarni and Ali Soroush},
journal= {arXiv preprint arXiv:2503.18562},
year = {2026}
}
备注
35 pages, 5 figures, 1 table, 7 supplementary figures