中文

VS-Assistant:面向外科医生需求的通用手术助手

计算机视觉与模式识别 2024-05-15 v1

摘要

外科手术干预对患者医疗保健至关重要,许多研究开发了先进的算法以为外科医生提供理解和决策辅助。尽管取得了巨大进展,但这些算法均针对单一特定任务和场景开发,在实践中需要手动组合不同功能,从而限制了其适用性。因此,期望一种智能且通用的手术助手能够准确理解外科医生的意图,并据此执行特定任务以支持手术过程。在本工作中,通过利用先进的多模态大语言模型(MLLM),我们提出了一种通用手术助手(VS-Assistant),它能够准确理解外科医生的意图并完成一系列手术理解任务,例如按需进行手术场景分析、手术器械检测与分割。具体而言,为实现卓越的手术多模态理解,我们设计了混合投影器(MOP)模块以对齐 VS-Assistant 中的手术 MLLM,从而平衡自然知识与手术知识。此外,我们设计了手术函数调用微调策略,使 VS-Assistant 能够理解手术意图,从而按需进行一系列手术函数调用以满足外科医生的需求。在神经外科数据上的大量实验证实,与现有 MLLM 相比,我们的 VS-Assistant 能更准确地理解外科医生的意图,在文本分析和视觉任务中均取得了压倒性的性能。源代码和模型将予以公开。

关键词

引用

@article{arxiv.2405.08272,
  title  = {VS-Assistant: Versatile Surgery Assistant on the Demand of Surgeons},
  author = {Zhen Chen and Xingjian Luo and Jinlin Wu and Danny T. M. Chan and Zhen Lei and Jinqiao Wang and Sebastien Ourselin and Hongbin Liu},
  journal= {arXiv preprint arXiv:2405.08272},
  year   = {2024}
}