借助掩码视频一致性重新思考视频分割:模型是否按预期学习?
计算机视觉与模式识别
2024-08-21 v1
摘要
视频分割旨在基于帧内的物体或感兴趣区域将视频序列划分为有意义的片段。当前的视频分割模型常源自图像分割技术,难以应对小规模或类别不平衡的视频数据集,这导致跨帧分割结果不一致。为此,我们提出一种训练策略——掩码视频一致性(Masked Video Consistency),以增强空间与时间特征聚合。MVC 引入随机掩码图像块的训练策略,迫使网络预测整个语义分割,从而提升上下文信息的集成。此外,我们引入对象掩码注意力(Object Masked Attention, OMA),通过减少无关查询的影响,优化交叉注意力机制,从而增强时序建模能力。我们的 метод最终集成到最新的解耦式通用视频分割框架中,在五个数据集上的三个视频分割任务中实现了状态的最佳性能,显著优于先前方法,却未增加模型参数。
引用
@article{arxiv.2408.10627,
title = {Rethinking Video Segmentation with Masked Video Consistency: Did the Model Learn as Intended?},
author = {Chen Liang and Qiang Guo and Xiaochao Qu and Luoqi Liu and Ting Liu},
journal= {arXiv preprint arXiv:2408.10627},
year = {2024}
}