用于视频实例分割的 Mask2Former
计算机视觉与模式识别
2021-12-21 v1 人工智能
机器学习
摘要
我们发现 Mask2Former 在不修改架构、损失甚至训练流程的情况下,也能在视频实例分割上取得最先进的性能。在本报告中,我们展示了通用图像分割架构通过直接预测 3D 分割体素可以平凡地推广到视频分割。具体而言,Mask2Former 在 YouTubeVIS-2019 上创下了 60.4 AP 的新最先进水平,在 YouTubeVIS-2021 上为 52.6 AP。鉴于其在图像分割中的多功能性,我们相信 Mask2Former 也能够处理视频语义和全景分割。我们希望这将使最先进的视频分割研究更易获取,并将更多注意力吸引到设计通用图像和视频分割架构上。
引用
@article{arxiv.2112.10764,
title = {Mask2Former for Video Instance Segmentation},
author = {Bowen Cheng and Anwesa Choudhuri and Ishan Misra and Alexander Kirillov and Rohit Girdhar and Alexander G. Schwing},
journal= {arXiv preprint arXiv:2112.10764},
year = {2021}
}
备注
Code and models: https://github.com/facebookresearch/Mask2Former