中文

通过利用时空一致性提高弱监督视频实例分割性能

计算机视觉与模式识别 2024-11-26 v2

摘要

视频实例分割(VIS)方法的性能随着Transformer网络的出现而显著提升。然而,这些网络在训练时常面临高标注成本的挑战。为解决这一问题,开发了无监督和弱监督方法以减少对标注的依赖。本工作引入一种新颖的弱监督方法,称为Eigen-Cluster VIS,该方法无需任何掩码标注,即可实现与其他VIS方法相当的准确度。该方法基于两个关键创新点:时序特征值损失(TEL)和剪辑级质量聚类系数(QCC)。TEL通过利用从图邻接矩阵派生的拉普拉斯矩阵特征值的特征值,确保时序一致性。通过最小化相邻帧特征值之间的平均绝对误差,该损失函数促进时间上平滑的过渡和稳定的分割边界,减少时序不连续性,提高整体分割质量。QCC采用K-means方法以无需依赖于 ground truth 掩码的方式确保时空聚类的质量。利用Davies-Bouldin得分,QCC提供一种无监督的特征判别度度量,使模型能够自我评估并适应不同对象分布,从而在测试阶段提高鲁棒性。这些改进计算效率高且操作简便,在不增加额外标注数据的情况下显著提升性能。本文评估了Eigen-Cluster VIS方法在YouTube-Video Instance Segmentation(YouTube-VIS)2019/2021和Occluded Video Instance Segmentation(OVIS)数据集上的表现,证明其有效缩小了完全监督和弱监督VIS方法之间的性能差距。代码已在 https://github.com/farnooshar/EigenClusterVIS 上提供。

关键词

引用

@article{arxiv.2408.16661,
  title  = {Improving Weakly-supervised Video Instance Segmentation by Leveraging Spatio-temporal Consistency},
  author = {Farnoosh Arefi and Amir M. Mansourian and Shohreh Kasaei},
  journal= {arXiv preprint arXiv:2408.16661},
  year   = {2024}
}

备注

12 pages, 6 Figures, 5 tabels