TTVOS:具有自适应模板注意力模块与时间一致性损失的轻量视频对象分割
计算机视觉与模式识别
2021-04-06 v3
摘要
半监督视频对象分割(semi-VOS)被广泛应用于许多场景中。该任务是从给定目标掩码跟踪与类别无关的对象。为此,基于在线学习、记忆网络与光流的各种方法已被提出。这些方法展现出高准确率,但由于推理时间慢与复杂度巨大而难以用于实际应用。为解决此问题,模板匹配方法被设计用于快速处理速度,但在先前模型中牺牲了大量性能。我们引入了一种基于模板匹配方法与时间一致性损失的新型半-VOS 模型,以在大幅加快推理时间的同时缩小与重型模型间的性能差距。我们的模板匹配方法由短期与长期匹配构成。短期匹配增强目标对象定位,而长期匹配通过新提出的自适应模板注意力模块改善细节并处理对象形状变化。然而,长期匹配在更新模板时由于过去估计结果的流入而导致误差传播。为缓解此问题,我们还提出了一种时间一致性损失,通过采用转移矩阵的概念以获得相邻帧间更好的时间相干性。我们的模型在 DAVIS16 基准上以 73.8 FPS 的速度获得了 79.5% 的 J&F 分数。代码可在 https://github.com/HYOJINPARK/TTVOS 获取。
引用
@article{arxiv.2011.04445,
title = {TTVOS: Lightweight Video Object Segmentation with Adaptive Template Attention Module and Temporal Consistency Loss},
author = {Hyojin Park and Ganesh Venkatesh and Nojun Kwak},
journal= {arXiv preprint arXiv:2011.04445},
year = {2021}
}