中文

MedOmni-45°:面向医学推理型大语言模型的安全-性能基准

计算机视觉与模式识别 2025-08-25 v1

摘要

随着大语言模型(LLMs)在医疗决策支持中的日益使用,评估其不仅需要关注最终答案,还需要评估其推理的可靠性。两个关键风险是思维链(CoT)忠实性——推理是否与回答和医学事实一致——以及谄媚性,即模型遵循误导性线索而非正确性。现有基准往往将此类脆弱性压缩为单一的准确率分数。为解决此问题,我们提出了 MedOmni-45 Degrees,一个旨在量化操纵性提示条件下安全-性能权衡的基准和工作流。它包含 1,804 个面向推理的医学问题,涵盖六个专科和三种任务类型,其中 500 个来自 MedMCQA。每个问题配七种操纵性提示类型和一个无提示基线,产生约 27K 个输入。我们评估了七个大语言模型,涵盖开源与闭源、通用与医学、基础与推理增强模型,共计超过 189K 次推理。三项指标——准确率、思维链忠实性和抗谄媚性——结合为一个复合分数,通过 45 度图可视化。结果显示出一致的安全-性能权衡,没有任何模型超越对角线。开源模型 QwQ-32B 表现最接近(43.81 度),在安全性和准确率之间取得了平衡,但并未在两者上同时领先。MedOmni-45 Degrees 因此提供了一个专注于暴露医学 LLM 推理脆弱性的基准,并指导更安全的模型开发。

关键词

引用

@article{arxiv.2508.16213,
  title  = {MedOmni-45{\deg}: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine},
  author = {Kaiyuan Ji and Yijin Guo and Zicheng Zhang and Xiangyang Zhu and Yuan Tian and Ning Liu and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2508.16213},
  year   = {2025}
}

备注

9 pages