PolypSegTrack:面向结肠镜视频分析的统一基础模型
计算机视觉与模式识别
2025-04-04 v2 人工智能
摘要
在结肠镜中对息肉进行早期检测、精确分割、分类和跟踪对于预防结直肠癌至关重要。目前许多基于深度学习的结肠镜视频分析方法要么需要任务特定的微调,要么缺乏跟踪功能,又或依赖于特定领域的预训练。在本文中,我们引入了PolypSegTrack,这是一个新的基础模型,旨在统一解决结肠镜视频中的息肉检测、分割、分类和无监督跟踪问题。我们的方法利用一种新颖的条件掩码损失,实现了在包含像素级分割掩码或边界框注释的数据集上的灵活训练,从而无需进行任务特定的微调。我们的无监督跟踪模块能够可靠地在帧之间关联息肉实例,且不依赖于任何启发式方法。我们采用在自然图像上无监督预训练的稳健视觉基础模型作为骨干网络,从而无需特定领域的预训练。在多个息肉基准数据集上的大量实验表明,我们的方法在检测、分割、分类和跟踪方面显著优于现有的领先方法。
引用
@article{arxiv.2503.24108,
title = {PolypSegTrack: Unified Foundation Model for Colonoscopy Video Analysis},
author = {Anwesa Choudhuri and Zhongpai Gao and Meng Zheng and Benjamin Planche and Terrence Chen and Ziyan Wu},
journal= {arXiv preprint arXiv:2503.24108},
year = {2025}
}