中文

一种半自监督的密集模式视频目标分割方法

计算机视觉与模式识别 2025-04-17 v2 图像与视频处理

摘要

视频目标分割(VOS)——预测视频每一帧中目标的像素级区域——在农业场景中尤其具有挑战性,因为作物视频包含数百个细小、密集且被遮挡的目标(茎、叶、花、荚),它们在风中摇摆并不可预测地移动。监督训练是VOS的最先进方法,但它需要大量像素级精确的人工标注视频,对于每帧包含许多密集目标的视频而言,制作成本高昂。为应对这些挑战,我们提出了一种半自监督的时空方法用于密集视频目标分割(DVOS),该方法基于扩散模型通过多任务(重建和分割)学习。我们首先使用模拟真实视频中相机和目标运动的合成数据训练模型,然后使用伪标签视频进行训练。我们在多样化的视频集(手持、无人机拍摄、不同田间位置和不同生长阶段——从孕穗期到小麦成熟和收获期)上评估了我们的DVOS方法用于麦穗分割。尽管仅使用了少量人工标注的视频帧,所提出的方法仍产生了高性能模型,在无人机拍摄的外部测试集上达到了0.79的Dice分数。虽然我们的方法是在麦穗分割上评估的,但它可以扩展到其他作物和领域,如人群分析或显微图像分析。

关键词

引用

@article{arxiv.2406.05131,
  title  = {A Semi-Self-Supervised Approach for Dense-Pattern Video Object Segmentation},
  author = {Keyhan Najafian and Farhad Maleki and Lingling Jin and Ian Stavness},
  journal= {arXiv preprint arXiv:2406.05131},
  year   = {2025}
}