中文

EndoARSS:为高效内镜手术活动识别与语义分割而构建的空间感知基础模型适配器

计算机视觉与模式识别 2025-06-10 v1 人工智能

摘要

内镜手术是机器人辅助Minimally invasive手术的金标准,为早期疾病检测和精确干预提供了显著优势。然而,手术场景的复杂性——表现为不同手术活动情景中的高度变异性以及目标与背景图像特征的混淆——为手术环境理解带来了挑战。传统深度学习模型常在跨活动干扰下表现不佳,导致下游任务性能 suboptimal。为解决这一局限,我们探索了多任务学习,该方法利用任务之间相关特征来提升整体性能。本文提出EndoARSS,一个专为内镜手术活动识别和语义分割设计的新型多任务学习框架。基于DINOv2基础模型构建,我们的方法集成了Low-Rank Adaptation以实现高效微调,同时引入Task Efficient Shared Low-Rank Adapters以缓解跨不同任务的梯度冲突。此外,我们提出Spatially-Aware Multi-Scale Attention,通过实现全局信息的跨空间学习来增强特征表示的判别性。为评估框架有效性,我们提出了三个新型数据集:MTLESD、MTLEndovis和MTLEndovis-Gen,专为内镜手术场景设计,包含活动识别和语义分割任务的详细标注。广泛的实验表明,EndoARSS在多个基准测试中实现了显著性能,显著优于现有模型。这些结果凸显了EndoARSS推动AI驱动内镜手术系统发展的潜力,为提高手术安全性和效率提供了宝贵见解。

关键词

引用

@article{arxiv.2506.06830,
  title  = {EndoARSS: Adapting Spatially-Aware Foundation Model for Efficient Activity Recognition and Semantic Segmentation in Endoscopic Surgery},
  author = {Guankun Wang and Rui Tang and Mengya Xu and Long Bai and Huxin Gao and Hongliang Ren},
  journal= {arXiv preprint arXiv:2506.06830},
  year   = {2025}
}

备注

Accepted by Advanced Intelligent Systems