用于手术场景理解的全局推理多任务学习模型
图像与视频处理
2022-01-31 v1 机器人学
摘要
全局与局部关系推理使场景理解模型能够执行类人的场景分析与理解。场景理解可实现更好的语义分割与物体间交互检测。在医学领域,鲁棒的手术场景理解模型可实现手术技能评估自动化、外科医生表现实时监测与术后分析。本文提出一种能够进行器械分割与工具-组织交互检测的全局推理多任务手术场景理解模型。我们于隐交互空间中引入全局关系推理,并在坐标空间中加入多尺度局部(邻域)推理以改进分割。利用多任务模型设置,视觉-语义图注意力网络在交互检测中的性能通过全局推理进一步增强。分割模块的全局交互空间特征被引入图网络,使其能基于节点间与全局交互推理检测交互。我们的模型通过共享公共模块降低了相比运行两个独立单任务模型的计算成本,这对实际应用不可或缺。利用序贯优化技术,所提多任务模型在 MICCAI 内窥镜视觉挑战赛 2018 数据集上优于其他最先进单任务模型。此外,我们也观察了使用知识蒸馏技术训练时多任务模型的表现。官方代码实现已发布于 GitHub。
引用
@article{arxiv.2201.11957,
title = {Global-Reasoned Multi-Task Learning Model for Surgical Scene Understanding},
author = {Lalithkumar Seenivasan and Sai Mitheran and Mobarakol Islam and Hongliang Ren},
journal= {arXiv preprint arXiv:2201.11957},
year = {2022}
}
备注
Code available at: https://github.com/lalithjets/Global-reasoned-multi-task-model