中文

面向大型视觉语言模型的多层次内窥镜手术运动数据集

计算机视觉与模式识别 2024-10-11 v1

摘要

黏膜下切除术(ESD)可实现大面积病灶的快速切除,最小化复发率,提高长期总生存率。尽管存在这些优势,ESD技术具有挑战性且并发症风险高, necessitating 熟练的外科医生和精密仪器。近期大型视觉语言模型(LVLMs)的快速发展为机器人系统提供了具有决策支持和预测规划能力的前景,这可以增强ESD的准确性并降低程序风险。然而,现有的针对多层次精细ESD手术运动理解的数据集稀缺且缺乏详细注释。在本文中,我们设计了ESD运动粒度的层次分解,并引入用于训练LVLMs作为机器人\textbf{Co}-\textbf{P}ilot的\textbf{E}ndoscopic \textbf{S}ubmucosal \textbf{D}issection的多层次手术运动数据集(CoPESD)。CoPESD包括17,679张图像,配有32,699个边界框和88,395个多层次运动,来自35小时以上的ESD视频,涵盖机器人辅助和传统手术。CoPESD支持对ESD运动的细粒度分析,聚焦于黏膜下切除的复杂任务。对LVLMs进行的大量实验表明,CoPESD在训练LVLMs预测跟随手术机器人运动方面效果显著。作为首个多模态ESD运动数据集,CoPESD支持ESD指令遵循和手术自动化的前沿研究。数据集可在\href{https://github.com/gkw0010/CoPESD}{https://github.com/gkw0010/CoPESD}获取。

关键词

引用

@article{arxiv.2410.07540,
  title  = {CoPESD: A Multi-Level Surgical Motion Dataset for Training Large Vision-Language Models to Co-Pilot Endoscopic Submucosal Dissection},
  author = {Guankun Wang and Han Xiao and Huxin Gao and Renrui Zhang and Long Bai and Xiaoxiao Yang and Zhen Li and Hongsheng Li and Hongliang Ren},
  journal= {arXiv preprint arXiv:2410.07540},
  year   = {2024}
}