中文

用于高质量视频实例分割的 Video Mask Transfiner

计算机视觉与模式识别 2022-07-29 v1

摘要

尽管视频实例分割 (VIS) 已取得快速进展,当前方法仍难以预测具有准确边界细节的高质量掩码。此外,预测的分割结果常随时间波动,表明时间一致性线索被忽视或未充分利用。本文着手解决这些问题,旨在为 VIS 实现高度精细且时间上更稳定的掩码预测。我们首先提出 Video Mask Transfiner (VMT) 方法,得益于高效的视频 transformer 结构,其能够利用细粒度高分辨率特征。我们的 VMT 检测并分组视频片段中每个轨迹的稀疏易错时空区域,随后利用局部与实例级线索对其进行细化。其次,我们确认流行的 YouTube-VIS 数据集的粗糙边界标注是主要限制因素。基于我们的 VMT 架构,我们因此设计了一种通过迭代训练与自校正实现的自动标注细化方法。为对 VIS 的高质量掩码预测进行基准测试,我们引入了 HQ-YTVIS 数据集,包含手动重新标注的测试集与我们的自动细化训练数据。我们在 HQ-YTVIS 以及 Youtube-VIS、OVIS 和 BDD100K MOTS 基准上将 VMT 与最新最先进方法进行比较。实验结果清晰地证明了我们的方法在分割复杂动态对象时通过捕捉精确细节所具有的功效与有效性。

关键词

引用

@article{arxiv.2207.14012,
  title  = {Video Mask Transfiner for High-Quality Video Instance Segmentation},
  author = {Lei Ke and Henghui Ding and Martin Danelljan and Yu-Wing Tai and Chi-Keung Tang and Fisher Yu},
  journal= {arXiv preprint arXiv:2207.14012},
  year   = {2022}
}

备注

ECCV 2022; Project page: https://www.vis.xyz/pub/vmt; Dataset page: https://www.vis.xyz/data/hqvis