PolypNextLSTM:基于ConvNext和ConvLSTM的轻量快速息肉视频分割网络
计算机视觉与模式识别
2024-02-29 v3 机器学习
摘要
在息肉分割中常用的单图像UNet架构缺乏临床医生在诊断息肉时从视频数据中获得的时间洞察力。为了更忠实地反映临床实践,我们提出的解决方案PolypNextLSTM利用基于视频的深度学习,利用时间信息以最少的参数开销实现卓越的分割性能,使其可能适用于边缘设备。PolypNextLSTM采用类似UNet的结构,以ConvNext-Tiny为骨干,策略性地省略最后两层以减少参数开销。我们的时间融合模块——卷积长短期记忆(ConvLSTM)——有效地利用了时间特征。我们的主要创新在于PolypNextLSTM,它是参数最少、速度最快的模型,在性能上超越了五个最先进的基于图像和视频的深度学习模型。对SUN-SEG数据集的评估涵盖了易检测和难检测的息肉场景,以及包含快速运动和遮挡等挑战性伪影的视频。与5个基于图像和5个基于视频的模型相比,PolypNextLSTM表现出优越性,在难检测息肉测试集上达到了0.7898的Dice分数,超过了基于图像的PraNet(0.7519)和基于视频的PNSPlusNet(0.7486)。值得注意的是,我们的模型在包含重影和遮挡等复杂伪影的视频中表现出色。PolypNextLSTM将精简的ConvNext-Tiny与用于时间融合的ConvLSTM相结合,不仅表现出卓越的分割性能,而且在评估模型中保持了最高的每秒帧数。代码访问地址:https://github.com/mtec-tuhh/PolypNextLSTM
引用
@article{arxiv.2402.11585,
title = {PolypNextLSTM: A lightweight and fast polyp video segmentation network using ConvNext and ConvLSTM},
author = {Debayan Bhattacharya and Konrad Reuter and Finn Behrendt and Lennart Maack and Sarah Grube and Alexander Schlaefer},
journal= {arXiv preprint arXiv:2402.11585},
year = {2024}
}