中文

面向外科安全的大型视觉语言模型结构化推理:Sum-of-Checks方法

机器学习 2026-04-27 v1 计算机视觉与模式识别

摘要

目的:准确评估胆囊切除术中的关键安全视图(Critical View of Safety, CVS)对于防止胆总管损伤至关重要,后者与显著的疾病负担和死亡率相关。虽然大型视觉语言模型(LVLMs)提供了灵活的推理能力,但其预测难以审计且在安全关键的外科任务中不可靠。方法:我们引入Sum-of-Checks框架,将每个CVS标准分解为反映临床相关视觉证据的专家定义推理检查。给定一次腹镜帧,LVM对每个检查进行评估,生成二元判断及依据。通过固定加权聚合检查结果计算标准级别得分。在Endoscapes2023基准上使用三个前沿LVM进行评估,比较直接提示、链式思考以及带/不带少量样本的子问题分解。结果:相对于最佳基线,Sum-of-Checks在所有三个模型和所有标准上将平均帧级平均精度提升12--14%。对 individual checks的分析显示,LVM在观察性检查(如可见性、工具阻塞)方面可靠,但在决策关键的解剖证据方面表现出显著变异。结论:将外科推理结构化为专家对齐的验证检查可提升LVM基于CVS评估的准确性和透明度,表明在可靠且可审计的外科AI系统中,显式地将证据收集与决策分离至关重要。代码已公开于https://github.com/BrachioLab/SumOfChecks。

关键词

引用

@article{arxiv.2604.22156,
  title  = {Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models},
  author = {Weiqiu You and Cassandra Goldberg and Amin Madani and Daniel A. Hashimoto and Eric Wong},
  journal= {arXiv preprint arXiv:2604.22156},
  year   = {2026}
}

备注

IPCAI 2026 short communication