中文

MT3DNet:用于3D手术场景重建的多任务学习网络

计算机视觉与模式识别 2024-12-13 v2 人工智能 人机交互 机器学习

摘要

在图像辅助的 minimally invasive surgery(MIS)中,理解手术场景对向外科医生提供实时反馈、技能评估以及通过协作人工智能程序改善疗效至关重要。在此背景下,挑战在于在高分辨率图像中准确检测、分割并估计手术场景的深度,同时重建场景的3D结构并为每件器械提供分割和检测标签。为此提出一种 novel 多任务学习(MTL)网络,用于同时完成上述任务。该方法的关键在于通过集成对抗性权重更新来克服处理多个任务时的优化难题。所提出的MTL模型通过整合分割、深度估计和目标检测,实现3D重建,从而增强对手术场景的理解,这与现有研究(缺乏3D能力)的显著不同。在EndoVis2018基准数据集上进行的全面实验表明,该模型熟练地处理所有三个任务,展示了所提出技术的有效性。

关键词

引用

@article{arxiv.2412.03928,
  title  = {MT3DNet: Multi-Task learning Network for 3D Surgical Scene Reconstruction},
  author = {Mithun Parab and Pranay Lendave and Jiyoung Kim and Thi Quynh Dan Nguyen and Palash Ingle},
  journal= {arXiv preprint arXiv:2412.03928},
  year   = {2024}
}

备注

1. Notation Update: Added * for equal contribution, ensuring proper attribution. 2. Subsection Fix: Removed the `subsection` tag for Section 3.1 (no 3.2 existed), maintaining content but fixing hierarchy. 3. Text Additions: Added lines in Section 5 and Subsection 4.2 for clarity, with references for better context