中文

基于空间时间强化学习的视频对象分割

计算机视觉与模式识别 2024-05-08 v1 人工智能

摘要

最近的视频对象分割(VOS)网络通常采用基于记忆的方法:对于每个查询帧,通过空间时间匹配记忆帧来预测掩码。尽管这些方法具有卓越的性能,但存在两个问题:1)挑战性数据会破坏相邻视频帧之间的空间时间一致性。2)像素级匹配会导致因噪声或干扰物引起的不理想匹配。为解决上述问题,我们首先提出在相邻帧之间生成一个辅助帧,作为查询帧的隐式短时参考。接着,我们为每个视频对象学习原型,并可在查询帧和记忆帧之间实现原型级匹配。实验表明,我们的网络在 DAVIS 2017 数据集上优于最先进的方法,获得 86.4% 的 J&F 分数,在 YouTube VOS 2018 上取得 85.0% 的竞争成绩。此外,我们的网络在推理速度上表现出 32+ FPS 的高速。

关键词

引用

@article{arxiv.2405.04042,
  title  = {Space-time Reinforcement Network for Video Object Segmentation},
  author = {Yadang Chen and Wentao Zhu and Zhi-Xin Yang and Enhua Wu},
  journal= {arXiv preprint arXiv:2405.04042},
  year   = {2024}
}

备注

Accepted by ICME 2024. 6 pages, 10 figures