基于空间时间强化学习的视频对象分割
计算机视觉与模式识别
2024-05-08 v1 人工智能
摘要
最近的视频对象分割(VOS)网络通常采用基于记忆的方法:对于每个查询帧,通过空间时间匹配记忆帧来预测掩码。尽管这些方法具有卓越的性能,但存在两个问题:1)挑战性数据会破坏相邻视频帧之间的空间时间一致性。2)像素级匹配会导致因噪声或干扰物引起的不理想匹配。为解决上述问题,我们首先提出在相邻帧之间生成一个辅助帧,作为查询帧的隐式短时参考。接着,我们为每个视频对象学习原型,并可在查询帧和记忆帧之间实现原型级匹配。实验表明,我们的网络在 DAVIS 2017 数据集上优于最先进的方法,获得 86.4% 的 J&F 分数,在 YouTube VOS 2018 上取得 85.0% 的竞争成绩。此外,我们的网络在推理速度上表现出 32+ FPS 的高速。
引用
@article{arxiv.2405.04042,
title = {Space-time Reinforcement Network for Video Object Segmentation},
author = {Yadang Chen and Wentao Zhu and Zhi-Xin Yang and Enhua Wu},
journal= {arXiv preprint arXiv:2405.04042},
year = {2024}
}
备注
Accepted by ICME 2024. 6 pages, 10 figures