面向临床医学影像的可解释工具瓶颈框架
计算机视觉与模式识别
2025-12-29 v1 机器学习
摘要
最近的工具使用框架由视觉语言模型(VLM)驱动,能够通过与专用工具对齐来提高图像理解能力。广泛而言,这些框架利用 VLM 和预先指定的工具箱,将预测任务分解为多个工具调用(通常为深度学习模型),这些模型通过组合来做出预测。主导方法是通过文本实现工具组合,通常嵌入 VLM 生成的代码或自然语言中。然而,这些方法在医学影像理解方面往往表现不佳,因为显著信息以空间局部化特征编码,难以仅通过文本进行组合或融合。为此,我们提出一种面向医学影像理解的工具使用框架,称为工具瓶颈框架(TBF),其通过学习的工具瓶颈模型(TBM)来组合 VLM 选择的工具。对于给定图像和任务,TBF 利用现成的医学 VLM 从工具箱中选择工具,这些工具各自提取临床相关特征。不同于文本驱动的组合,这些工具由 TBM 计算并融合,其输出通过神经网络进行融合后输出最终预测。我们提出一种简单有效的策略,使 TBM 能够与任意 VLM 工具选择一起进行预测。总体而言,我们的框架不仅改进了医学影像中的工具使用,也产生更具可解释性和临床导向的预测器。我们在组织病理和皮肤病理任务上进行评估,发现这些优势使我们的框架在与深度学习分类器、VLM 和最新工具使用框架相当或更好的前提下,尤其在数据受限时表现出显著提升。我们的代码可在 https://github.com/christinaliu2020/tool-bottleneck-framework 查阅。
引用
@article{arxiv.2512.21414,
title = {A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding},
author = {Christina Liu and Alan Q. Wang and Joy Hsu and Jiajun Wu and Ehsan Adeli},
journal= {arXiv preprint arXiv:2512.21414},
year = {2025}
}