MAST:基于混合注意力连体Transformer的视频息肉分割
计算机视觉与模式识别
2024-01-24 v1
摘要
从结肠镜视频中精确分割息肉对于息肉治疗和结直肠癌的早期预防具有重要意义。然而,由于对结肠镜视频中的长程时空关系进行建模存在困难,该任务极具挑战性。在本文中,我们提出了一种新颖的混合注意力连体Transformer(MAST)来解决这一挑战性任务,该模型通过混合注意力机制显式地建模长程时空关系,以实现精确的息肉分割。具体而言,我们首先构建了一个连体Transformer架构,以联合编码成对的视频帧,获取其特征表示。然后,我们设计了一个混合注意力模块来利用帧内和帧间相关性,用丰富的时空关系增强特征。最后,增强后的特征被送入两个并行解码器以预测分割图。据我们所知,我们的MAST是首个专用于视频息肉分割的Transformer模型。在大规模SUN-SEG基准数据集上的大量实验表明,与最先进的竞争者相比,MAST具有优越的性能。我们的代码已公开发布在https://github.com/Junqing-Yang/MAST。
引用
@article{arxiv.2401.12439,
title = {MAST: Video Polyp Segmentation with a Mixture-Attention Siamese Transformer},
author = {Geng Chen and Junqing Yang and Xiaozhou Pu and Ge-Peng Ji and Huan Xiong and Yongsheng Pan and Hengfei Cui and Yong Xia},
journal= {arXiv preprint arXiv:2401.12439},
year = {2024}
}