通过掩码视频一致性在VSPW数据集上的语义分割
计算机视觉与模式识别
2024-06-10 v1
摘要
像素级视频理解需要有效整合空间和时间维度的三维数据,以从连续帧中学习准确且稳定的语义信息。然而,VSPW数据集上现有的先进模型尚未充分建模时空关系。在本文中,我们介绍了针对PVUW竞赛的解决方案,其中我们在现有模型基础上引入了掩码视频一致性(MVC)。MVC强制随机遮挡补丁的掩码帧的预测之间保持一致性。模型需要通过图像上下文以及视频前后帧之间的关系来学习被掩码部分的分割结果。此外,我们采用了测试时增强、模型集成和基于多模态模型的后处理方法。我们的方法在VSPW数据集上达到了67.27%的mIoU性能,在PVUW2024挑战赛VSS赛道中排名第二。
引用
@article{arxiv.2406.04979,
title = {Semantic Segmentation on VSPW Dataset through Masked Video Consistency},
author = {Chen Liang and Qiang Guo and Chongkai Yu and Chengjing Wu and Ting Liu and Luoqi Liu},
journal= {arXiv preprint arXiv:2406.04979},
year = {2024}
}