外科AI中数据、计算与扩展的比较研究:潜力与局限
人工智能
2026-05-19 v3 计算机视觉与模式识别
机器学习
摘要
近期人工智能模型在多项生物医学任务性能的基准测试中已达到或超过人类专家水平,但外科基准测试尤其在知名医学基准套件中经常缺失。由于手术需要整合不同任务,通用的AI模型如果性能得以提升,可能作为协作工具特别有吸引力。一方面,扩展架构规模和训练数据的经典方法具有吸引力,尤其是考虑到每年有数百万小时的外科视频数据生成。另一方面,准备外科数据用于AI训练需要显著更高水平的专业知识,且在该数据上训练需要昂贵的计算资源。这些权衡描绘了一幅不确定的图景,即现代AI是否以及在多大程度上能够辅助外科实践。在本文中,我们通过一项使用2026年可用最先进AI方法进行外科工具检测的案例研究来探讨这一问题。我们证明,即使使用数十亿参数模型和广泛训练,当前视觉语言模型在神经外科中看似简单的工具检测任务上仍有所不足。此外,我们展示了扩展实验,表明增加模型规模和训练时间仅导致相关性能指标的递减改善。因此,我们的实验表明当前模型在外科使用场景中仍可能面临重大障碍。此外,一些障碍无法简单地通过额外计算来"扩展消除",且在不同模型架构中持续存在,这引发了数据和标签可用性是否是唯一限制因素的问题。我们讨论了这些限制的主要贡献因素并提出了潜在解决方案。
引用
@article{arxiv.2603.27341,
title = {A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scaling},
author = {Kirill Skobelev and Eric Fithian and Yegor Baranovski and Jack Cook and Sandeep Angara and Shauna Otto and Zhuang-Fang Yi and John Zhu and Daniel A. Donoho and X. Y. Han and Neeraj Mainkar and Margaux Masson-Forsythe},
journal= {arXiv preprint arXiv:2603.27341},
year = {2026}
}