用于快速在线视频实例分割的交叉学习
计算机视觉与模式识别
2021-04-14 v1
摘要
跨帧建模时间视觉上下文对视频实例分割(VIS)及其他视频理解任务至关重要。本文中,我们提出一种名为 CrossVIS 的快速在线 VIS 模型。针对 VIS 中的时间信息建模,我们提出一种新颖的交叉学习方案,该方案利用当前帧中的实例特征逐像素定位其他帧中的同一实例。与先前方案不同,交叉学习不需要任何额外的网络参数用于特征增强。通过与实例分割损失相结合,交叉学习实现了高效的跨帧实例到像素关系学习,并在推理时带来无额外成本的提升。此外,提出了一个全局平衡实例嵌入分支,以实现更准确、更稳定的在线实例关联。我们在三个具有挑战性的 VIS 基准(即 YouTube-VIS-2019、OVIS 和 YouTube-VIS-2021)上进行了大量实验来评估我们的方法。据我们所知,CrossVIS 在所有在线 VIS 方法中取得了最先进的性能,并展现出延迟与精度之间良好的权衡。代码将公开以促进未来研究。
引用
@article{arxiv.2104.05970,
title = {Crossover Learning for Fast Online Video Instance Segmentation},
author = {Shusheng Yang and Yuxin Fang and Xinggang Wang and Yu Li and Chen Fang and Ying Shan and Bin Feng and Wenyu Liu},
journal= {arXiv preprint arXiv:2104.05970},
year = {2021}
}