解决视频目标分割中工作记忆问题的若干方法
计算机视觉与模式识别
2024-10-31 v1 人工智能
摘要
当代SOTA视频目标分割(VOS)模型通过affinity或cross-attention将当前无标注图像与历史图像-掩码关系进行比较,以预测目标掩码。我们将初始图像-掩码对及过去图像-掩码的内部记忆状态称为工作记忆缓冲区。虽然当前SOTA模型在干净视频数据上表现优异,但其对前一帧工作记忆的依赖留下了错误空间。基于affinity的算法包含temporal continuity between consecutive frames的归纳偏置。为消除所需目标在不一致摄像视角下的工作记忆模型需要一种算法修改,以调节记忆更新并避免将无关帧写入工作记忆。我们提出了一种可应用于任何现有工作记忆基于VOS模型的简单算法修改,以提高其在不一致视角(如突然的摄像机切割、帧插入及极端情境变化)上的性能。结果模型性能在含有帧插入的视频数据上相对于未采用该算法修改的模型表现显著提升。我们的贡献是一种简单决策函数,用于确定工作记忆是否应更新,基于检测到突然的极端变化及假设目标已不在画面中的事实。通过实施此类算法修改,我们可以提高当前VOS模型的实际应用性。
引用
@article{arxiv.2410.22451,
title = {Addressing Issues with Working Memory in Video Object Segmentation},
author = {Clayton Bromley and Alexander Moore and Amar Saini and Douglas Poland and Carmen Carrano},
journal= {arXiv preprint arXiv:2410.22451},
year = {2024}
}
备注
12 pages, 11 figures