H-Net:面向内皮动物球差 catheter 同时进行 3D 力量估计与立体语义分割的多任务架构
图像与视频处理
2025-01-03 v1 人工智能
计算机视觉与模式识别
机器学习
机器人学
摘要
球差手术的成功率密切取决于给外科医生提供的感知数据。基于视觉的深度学习模型能够在无传感器的情况下提供触觉与视觉信息,同时具有成本效益。鉴于这些模型在计算资源有限的器械上的复杂性,研究侧重于力量估计与球差分割各自进行。然而,缺乏一种能够同时从两个不同角度分割球差并估计三维施加力量的综合性架构。为弥合这一差距,本工作提出一种新型、轻量级、多输入多输出的编码器-解码器架构。该架构旨在分割来自两个视角的球差,并同时测量在 x、y、z 方向上施加的力量。该网络处理两个同步 X 射线图像,预计由双腔飞行辐射系统提供,显示来自不同角度的球差偏转。它使用两个具有共享参数的平行子网络输出对应输入的两个分割图。此外,它利用立体视觉来估计球差末端施加的三维力量。该架构具有两个输入通道、用于分割的两个分类头以及通过单一端到端架构用于力量估计的回归头。所有头部的输出被评估并与文献中方法进行比较,显示在分割和力量估计方面均实现了最新水平。鉴于作者所知,这是首次提出此类模型。
引用
@article{arxiv.2501.00514,
title = {H-Net: A Multitask Architecture for Simultaneous 3D Force Estimation and Stereo Semantic Segmentation in Intracardiac Catheters},
author = {Pedram Fekri and Mehrdad Zadeh and Javad Dargahi},
journal= {arXiv preprint arXiv:2501.00514},
year = {2025}
}