面向手术场景理解的、具有类增量对比学习的任务感知异步多任务模型
人工智能
2022-11-29 v1 计算机视觉与模式识别
机器人学
图像与视频处理
摘要
目的:具有器械-组织交互识别和自动报告生成的手术场景理解,在机器人手术的术中引导、决策制定和术后分析中可发挥重要作用。然而,不同手术之间的域偏移,伴随患者间和患者内的变异以及新器械的出现,会降低模型预测的性能。此外,它需要多个模型的输出,这可能计算代价高昂并影响实时性能。方法:提出一种多任务学习(MTL)模型,用于手术报告生成和器械-组织交互预测,以应对域偏移问题。该模型由共享特征提取器、用于字幕生成的网格变换器分支和用于器械-组织交互预测的图注意力分支构成。共享特征提取器采用类增量对比学习(CICL)来应对目标域中的强度偏移和新类别出现。我们设计了基于高斯拉普拉斯算子(LoG)的课程学习,并将其融入共享分支和任务特定分支,以增强模型学习。我们引入了一种任务感知异步MTL优化技术,以微调共享权重并使两个任务最优收敛。结果:使用任务感知优化和微调技术训练的MTL模型,在目标域的两个任务上报告了均衡的性能(场景字幕BLEU分数0.4049,交互检测准确率0.3508),并在域适应中与单任务模型表现相当。结论:所提出的多任务模型能够适应域偏移,融入目标域中的新器械,并以与单任务模型相当的水平执行器械-组织交互检测和报告生成。
引用
@article{arxiv.2211.15327,
title = {Task-Aware Asynchronous Multi-Task Model with Class Incremental Contrastive Learning for Surgical Scene Understanding},
author = {Lalithkumar Seenivasan and Mobarakol Islam and Mengya Xu and Chwee Ming Lim and Hongliang Ren},
journal= {arXiv preprint arXiv:2211.15327},
year = {2022}
}
备注
Manuscript accepted in the International Journal of Computer Assisted Radiology and Surgery. codes available: https://github.com/lalithjets/Domain-adaptation-in-MTL