以改进内存覆盖重新思考时空网络以实现高效视频目标分割
计算机视觉与模式识别
2021-10-11 v2
摘要
本文提出了一种在视频目标分割背景下建模时空对应关系的简单而有效的方法。与大多数现有方法不同,我们直接建立帧间的对应关系,而无需为每个对象重新编码掩码特征,从而得到一个高效且鲁棒的框架。利用这些对应关系,当前查询帧中的每个节点通过关联方式聚合来自过去的特征进行推断。我们将聚合过程视为一个投票问题,并发现现有的内积亲和度会导致内存利用不佳,一小部分(固定的)内存节点主导投票,而不论查询如何。鉴于此现象,我们提出改用负平方欧氏距离来计算亲和度。我们验证了现在每个内存节点都有机会贡献,并通过实验表明这种多样化投票有利于内存效率和推理精度。对应关系网络与多样化投票的协同作用表现极佳,在 DAVIS 和 YouTubeVOS 数据集上均取得了新的最先进结果,同时在无额外修饰的情况下以 20+ FPS 的速度显著更快地运行于多对象。
引用
@article{arxiv.2106.05210,
title = {Rethinking Space-Time Networks with Improved Memory Coverage for Efficient Video Object Segmentation},
author = {Ho Kei Cheng and Yu-Wing Tai and Chi-Keung Tang},
journal= {arXiv preprint arXiv:2106.05210},
year = {2021}
}
备注
Accepted to NeurIPS 2021. Project page: https://hkchengrex.github.io/STCN/