中文

用于快速在线视频实例分割的交叉学习

计算机视觉与模式识别 2021-04-14 v1

摘要

跨帧建模时间视觉上下文对视频实例分割(VIS)及其他视频理解任务至关重要。本文中,我们提出一种名为 CrossVIS 的快速在线 VIS 模型。针对 VIS 中的时间信息建模,我们提出一种新颖的交叉学习方案,该方案利用当前帧中的实例特征逐像素定位其他帧中的同一实例。与先前方案不同,交叉学习不需要任何额外的网络参数用于特征增强。通过与实例分割损失相结合,交叉学习实现了高效的跨帧实例到像素关系学习,并在推理时带来无额外成本的提升。此外,提出了一个全局平衡实例嵌入分支,以实现更准确、更稳定的在线实例关联。我们在三个具有挑战性的 VIS 基准(即 YouTube-VIS-2019、OVIS 和 YouTube-VIS-2021)上进行了大量实验来评估我们的方法。据我们所知,CrossVIS 在所有在线 VIS 方法中取得了最先进的性能,并展现出延迟与精度之间良好的权衡。代码将公开以促进未来研究。

关键词

引用

@article{arxiv.2104.05970,
  title  = {Crossover Learning for Fast Online Video Instance Segmentation},
  author = {Shusheng Yang and Yuxin Fang and Xinggang Wang and Yu Li and Chen Fang and Ying Shan and Bin Feng and Wenyu Liu},
  journal= {arXiv preprint arXiv:2104.05970},
  year   = {2021}
}