Diff-VPS:基于多任务扩散网络及对抗时序推理的视频多余肠 Segmentation
计算机视觉与模式识别
2024-09-12 v1 信息检索
摘要
扩散概率模型因其卓越的性能而在计算机视觉领域引起广泛关注。然而,尽管大量扩散模型研究聚焦于生成任务,但尚无工作将扩散模型引入视频多余肠分割,后者常因多余肠的高伪装性及冗余时序线索而面临挑战。本文提出一种新颖的基于扩散的视频多余肠分割网络,称为 Diff-VPS。我们将多任务监督引入扩散模型,以提升其在像素级分割任务中的判别能力,从而融合通过联合分类与检测任务实现的上下文高层信息。为探索时序依赖性,设计了时序推理模块(TRM),通过从前序帧推理并重构目标帧来实现。进一步地,我们采用生成对抗自监督策略赋予 TRM,以生成更逼真的帧,捕获更佳的动态线索。通过在 SUN-SEG 上的大量实验表明,我们提出的 Diff-VPS 已显著实现了最先进的性能。代码已公开于 https://github.com/lydia-yllu/Diff-VPS。
引用
@article{arxiv.2409.07238,
title = {Diff-VPS: Video Polyp Segmentation via a Multi-task Diffusion Network with Adversarial Temporal Reasoning},
author = {Yingling Lu and Yijun Yang and Zhaohu Xing and Qiong Wang and Lei Zhu},
journal= {arXiv preprint arXiv:2409.07238},
year = {2024}
}