中文

XMem:基于 Atkinson-Shiffrin 记忆模型的长期视频对象分割

计算机视觉与模式识别 2022-07-19 v2

摘要

我们提出 XMem,一种用于长视频的视频对象分割架构,其统一特征记忆存储受 Atkinson-Shiffrin 记忆模型启发。先前关于视频对象分割的工作通常仅使用一种类型的特征记忆。对于超过一分钟的视频,单一特征记忆模型将记忆消耗与精度紧密绑定。相反,遵循 Atkinson-Shiffrin 模型,我们开发了一种融合多个独立但深度连接的特征记忆存储的架构:快速更新的感觉记忆、高分辨率的工作记忆,以及紧凑从而可维持的长期记忆。关键的是,我们开发了记忆增强算法,定期将活跃使用的工作记忆元素整合进长期记忆,从而避免记忆爆炸并最小化长期预测的精度衰减。结合一种新的记忆读取机制,XMem 在长视频数据集上大幅超越最先进性能,同时在短视频数据集上与最先进方法(不适用于长视频)持平。代码见 https://hkchengrex.github.io/XMem

关键词

引用

@article{arxiv.2207.07115,
  title  = {XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model},
  author = {Ho Kei Cheng and Alexander G. Schwing},
  journal= {arXiv preprint arXiv:2207.07115},
  year   = {2022}
}

备注

Accepted to ECCV 2022. Project page: https://hkchengrex.github.io/XMem