中文

RMem:受限记忆库提升视频目标分割性能

计算机视觉与模式识别 2025-01-15 v2 人工智能

摘要

随着近期视频目标分割(VOS)基准向具有挑战性的场景演进,我们重新审视了一个简单但被忽视的策略:限制记忆库的大小。这与当前普遍采用的扩展记忆库以容纳大量历史信息的做法背道而驰。我们专门设计的“记忆解读”研究为这一策略提供了关键洞见:扩展记忆库虽然看似有益,但实际上由于冗余信息造成的混淆,增加了VOS模块解码相关特征的难度。通过将记忆库限制在有限数量的关键帧上,我们显著提升了VOS的准确率。该过程平衡了帧的重要性和新鲜度,以在有限容量内维持信息丰富的记忆库。此外,与持续扩展相比,受限记忆库减少了记忆长度上的训练-推理差异。这为时序推理带来了新的机遇,并使我们能够引入先前被忽视的“时序位置嵌入”。最后,我们的见解体现在“RMem”(“R”代表受限)中,这是一种简单而有效的VOS改进方法,在具有挑战性的VOS场景中表现出色,并在目标状态变化(在VOST数据集上)和长视频(在Long Videos数据集上)方面建立了新的最先进水平。我们的代码和演示可在 https://restricted-memory.github.io/ 获取。

关键词

引用

@article{arxiv.2406.08476,
  title  = {RMem: Restricted Memory Banks Improve Video Object Segmentation},
  author = {Junbao Zhou and Ziqi Pang and Yu-Xiong Wang},
  journal= {arXiv preprint arXiv:2406.08476},
  year   = {2025}
}

备注

CVPR 2024, Project Page: https://restricted-memory.github.io/