AVPDN:面向视频基肠溢息检测的学习型运动鲁健与尺度自适应表征
计算机视觉与模式识别
2025-08-06 v1
摘要
精准检测肠溢息对于早期和中期结直肠癌诊断至关重要。与静态图像相比,动态结肠镜视频提供更为全面的视觉信息,可有助于制定有效的治疗方案。然而,与固定摄像机录制不同,结肠镜视频常常出现快速的摄像机运动,引入大量背景噪声,破坏场景的结构完整性,增加假阳性风险。为此,我们提出了自适应视频肠溢息检测网络(AVPDN),面向结肠镜视频的多尺度肠溢息检测提供稳健框架。AVPDN包含两个关键组件:自适应特征交互与增强(AFIA)模块和尺度感知上下文集成(SACI)模块。AFIA模块采用三分支架构来增强特征表示。它采用稠密自注意力进行全局上下文建模,稀疏自注意力以缓解特征聚合中低查询-键相似度的影响,以及通道混洗操作以促进分支间的信息交换。在平行地,SACI模块设计用于强化多尺度特征集成。它利用具有不同感受野的膨胀卷积,在多个空间尺度上捕获上下文信息,从而提高模型的去噪能力。在几个具有挑战性的公开基准数据集上的实验结果表明,所提方法有效且具有良好的泛化能力,实现了视频基肠溢息检测任务的具竞争力性能。
引用
@article{arxiv.2508.03458,
title = {AVPDN: Learning Motion-Robust and Scale-Adaptive Representations for Video-Based Polyp Detection},
author = {Zilin Chen and Shengnan Lu},
journal= {arXiv preprint arXiv:2508.03458},
year = {2025}
}