大型视觉语言模型用于外科人工智能的系统评估
计算机视觉与模式识别
2025-04-04 v1 人工智能
摘要
大型视觉语言模型提供了一种新的范式,用于 AI 驱动的图像理解,使模型能够在无需任务特定训练的情况下执行任务。这种灵活性在医疗领域尤为有前景,因为专家标注数据稀缺。然而,VLMs 在以干预为导向的领域——特别是外科手术中——的实际用途仍不明确,因为决策是主观的且临床情景多变。本文对 11 个最先进的 VLMs 在外科 AI 中的 17 个关键视觉理解任务(从解剖识别到技能评估)进行全面分析,这些任务使用 13 个数据集,涵盖腹腔手术、机器人手术和开放手术。我们实验中发现,VLMs 在某些情况下展现出有前景的通用性,甚至在部署其训练设置之外时表现优于监督模型。在测试期间 incorporating 示例以进行情境学习,可提升性能最高可达三倍,表明可适应性是其关键优势。然而,仍需解决需要空间或时间推理的任务。除了外科手术,我们的发现为 VLMs 在处理临床和更广泛现实场景中的复杂动态情景提供了见解。
引用
@article{arxiv.2504.02799,
title = {Systematic Evaluation of Large Vision-Language Models for Surgical Artificial Intelligence},
author = {Anita Rau and Mark Endo and Josiah Aklilu and Jaewoo Heo and Khaled Saab and Alberto Paderno and Jeffrey Jopling and F. Christopher Holsinger and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2504.02799},
year = {2025}
}