中文

基于传播与语义双教师网络的单帧监督视频多边形分割

计算机视觉与模式识别 2024-12-24 v1

摘要

自动视频多边形分割在肠胃癌筛查中发挥着关键作用,但逐帧标注的成本极高。虽然稀疏帧监督方法已按比例降低了这一负担,但在长时长视频和大规模数据集上,成本仍令人难以接受。本文首次将标注成本降低到每个多边形视频仅需一帧。为此,我们提出了新的任务——单帧监督视频多边形分割(FSVPS),并设计了新的 Propagative and Semantic Dual-Teacher Network(PSDNet)。具体而言,PSDNet 采用教师-学生框架,但使用两种不同类型的教师:传播教师和语义教师。传播教师是一个通用对象跟踪器,将第一帧的标注传递到后续帧作为伪标签。然而,随着时间的推移,跟踪误差可能会累积,逐渐损坏伪标签并误导学生模型。为此,我们引入语义教师,即学生模型的指数移动平均,产生更稳定和时间不变的伪标签。PSDNet 使用精心设计的反向传播策略合并两种教师的伪标签。该策略通过将其反向跟踪到第一帧来评估伪标签的质量。高质量的伪标签在反向跟踪后更可能与第一帧的标注在空间上对齐,从而确保更准确的教师到学生的知识传递并提高分割性能。在最大的 VPS 数据集 SUN-SEG 上进行基准测试,表明 PSDNet 在与完全监督方法相当的性能方面具有竞争力,并且在稀疏帧监督的最新方法上实现了至少 4.5% 的 Dice 评分提升。

关键词

引用

@article{arxiv.2412.16503,
  title  = {First-frame Supervised Video Polyp Segmentation via Propagative and Semantic Dual-teacher Network},
  author = {Qiang Hu and Mei Liu and Qiang Li and Zhiwei Wang},
  journal= {arXiv preprint arXiv:2412.16503},
  year   = {2024}
}

备注

Accepted by ICASSP 2024. Code and models: https://github.com/Huster-Hq/PSDNet