中文

DeepSeek 能像外科医生一样推理吗?机器人辅助手术中视觉-语言理解的实证评估

计算机视觉与模式识别 2025-04-07 v3 计算与语言 机器人学

摘要

得益于其高效的训练范式和强大的推理能力,DeepSeek 模型在通用场景理解、问答(QA)和文本生成任务中展现出了卓越的性能。在本研究中,我们调查了 DeepSeek 模型在机器人手术场景中的对话能力,重点关注单短语 QA、视觉 QA 和详细描述等任务。单短语 QA 任务进一步包括手术器械识别、动作理解和空间位置分析等子任务。我们使用公开可用的数据集(包括 EndoVis18 和 CholecT50)及其对应的对话数据进行广泛评估。我们的实证研究表明,与现有的通用多模态大语言模型相比,DeepSeek-VL2 在手术场景中的复杂理解任务上表现更好。此外,尽管 DeepSeek-V3 纯粹是一个语言模型,我们发现当直接输入图像 token 时,该模型在单句 QA 任务上展现出更好的性能。然而,总体而言,DeepSeek 模型仍未能满足理解手术场景的临床要求。在通用提示下,DeepSeek 模型缺乏有效分析全局手术概念的能力,无法提供对手术场景的详细见解。基于我们的观察,我们认为如果不针对手术特定数据集进行微调,DeepSeek 模型尚未准备好用于手术环境中的视觉-语言任务。

关键词

引用

@article{arxiv.2503.23130,
  title  = {Can DeepSeek Reason Like a Surgeon? An Empirical Evaluation for Vision-Language Understanding in Robotic-Assisted Surgery},
  author = {Boyi Ma and Yanguang Zhao and Jie Wang and Guankun Wang and Kun Yuan and Tong Chen and Long Bai and Hongliang Ren},
  journal= {arXiv preprint arXiv:2503.23130},
  year   = {2025}
}

备注

Technical Report