中文

CNS-Obsidian: A neurosurgical vision-language model built from scientific publications

人工智能 2025-11-26 v5 计算与语言 人机交互

摘要

通用视觉语言模型 (VLM) 在未经精选的互联网数据训练下的不透明性,构成了针对高风险决策(如神经外科)的关键限制。我们提出 CNS-Obsidian,一种基于同行评审文献训练的神经外科 VLM,展示其临床实用性。我们收集了来自 Neurosurgery Publications 期刊的 23,984 篇文章,包含 78,853 幅图表和说明文字。使用 GPT-4o 和 Claude Sonnet-3.5 将其转换为 263,064 个训练样本,涵盖三种格式:指令微调、多选问答和差异诊断。我们训练了 CNS-Obsidian,这是对 340 亿参数 LLaVA-Next 模型的微调。在 NYU Langone Health 进行的盲法随机试验(2024 年 8 月 30 日至 11 月 30 日),神经外科咨询被随机分配给 CNS-Obsidian 或符合 HIPAA 要求的 GPT-4o 端点作为诊断伴侣。主要结果包括诊断有用性和准确性,通过用户评级和 VLM 提供的差异诊断中是否包含正确诊断进行评估。CNS-Obsidian 在合成问题上以 76.13% 的准确率匹配 GPT-4o(77.54%,p=0.235),但在人类生成问题上仅达到 46.81% 的准确率,而 GPT-4o 为 65.70%(p<10^-15)。在随机试验中,评估了 70 项咨询(32 项 CNS-Obsidian,38 项 GPT-4o),占总咨询量 7.3%。CNS-Obsidian 在 40.62% 的案例中获得积极评价,而 GPT-4o 为 57.89%(p=0.230)。两者在约 60% 的案例中都包含正确诊断(59.38% vs 65.79%,p=0.626)。基于精选科学文献训练的领域特定 VLM 尽管规模小且训练成本低,却可接近前沿模型性能。这为科学社区构建专门 AI 模型提供了透明框架。

关键词

引用

@article{arxiv.2502.19546,
  title  = {CNS-Obsidian: A Neurosurgical Vision-Language Model Built From Scientific Publications},
  author = {Anton Alyakin and Jaden Stryker and Daniel Alexander Alber and Jin Vivian Lee and Karl L. Sangwon and Brandon Duderstadt and Akshay Save and David Kurland and Spencer Frome and Shrutika Singh and Jeff Zhang and Eunice Yang and Ki Yun Park and Cordelia Orillac and Aly A. Valliani and Sean Neifert and Albert Liu and Aneek Patel and Christopher Livia and Darryl Lau and Ilya Laufer and Peter A. Rozman and Eveline Teresa Hidalgo and Howard Riina and Rui Feng and Todd Hollon and Yindalon Aphinyanaphongs and John G. Golfinos and Laura Snyder and Eric Leuthardt and Douglas Kondziolka and Eric Karl Oermann},
  journal= {arXiv preprint arXiv:2502.19546},
  year   = {2025}
}