中文

医学推理中闭源 LLM 可信度评估:仅仅合乎道理还是忠实于事实?

机器人学 2026-03-17 v1

摘要

闭源大语言模型 (LLM) 如 ChatGPT 和 Gemini 正在为医学咨询提供建议,但其解释可能看似合乎道理,却未能反映模型底层的推理过程。这一差距可能带来严重风险,因为患者和医生可能会信赖这些自洽却误导性的解释。我们对三种广泛使用的闭源 LLM 在医学推理中的可信度进行系统性的黑盒评估。我们的研究包括三个基于扰动的探针:(1) 因果消除,测试声明的链式思维 (CoT) 推理是否在预测中起因果作用;(2) 位置偏差,检验模型是否为由输入位置驱动的答案创建事后合理化;(3) 提示注入,测试模型对外部建议的易受程度。我们补充了对模型响应的小规模人类评估,以检验医师对解释可信度的判断与普通人对可信度的感知之间的一致性。我们发现,CoT 推理步骤往往不具备因果驱动预测作用,模型会轻易整合外部提示而不加以 acknowledgment。相比之下,在本研究情境下,位置偏差显示出最小影响。这些结果凸显,可信度不仅仅是准确性,必须是医学应用中评估 LLM 的核心,以确保公共保护和安全的临床部署。

关键词

引用

@article{arxiv.2603.13987,
  title  = {Vision-guided Autonomous Dual-arm Extraction Robot for Bell Pepper Harvesting},
  author = {Kshitij Madhav Bhat and Tom Gao and Abhishek Mathur and Rohit Satishkumar and Francisco Yandun and Dominik Bauer and Nancy Pollard},
  journal= {arXiv preprint arXiv:2603.13987},
  year   = {2026}
}

备注

9 pages; first four authors have equal contribution