LiVOS:基于门控线性匹配的轻量视频对象分割
计算机视觉与模式识别
2024-11-06 v1
摘要
半监督视频对象分割(VOS)很大程度上由空间-时间记忆(STM)网络驱动,这些网络将过去帧的特征存储在时空记忆中,通过softmax注意力分割当前帧。然而,STM网络面临内存限制,因为softmax匹配的二次复杂度,随着视频长度和分辨率的增加限制了其适用性。为了解决这个问题,我们提出了LiVOS,一种轻量记忆网络,采用线性匹配通过线性注意力,将记忆匹配重新表述为一个循环过程,将二次注意力矩阵缩减为常数大小的时空无关2D状态。为了增强选择性,我们引入了门控线性匹配,其中数据依赖的门控矩阵与状态矩阵相乘,以控制保留或丢弃哪些信息。在多样化基准上的实验证明了我们的方法的有效性。它在MOSE上达到64.8 J&F,在DAVIS上达到85.1 J&F,超越了所有非STM方法并缩小了与基于STM方法的差距。对于更长和更高分辨率的视频,它以53%更少的GPU内存匹配了基于STM的方法,并支持在32G消费级GPU上进行4096p推理——这是一个之前成本 prohibitive 的能力——为长视频和高分辨率视频基础模型打开了大门。
引用
@article{arxiv.2411.02818,
title = {LiVOS: Light Video Object Segmentation with Gated Linear Matching},
author = {Qin Liu and Jianfeng Wang and Zhengyuan Yang and Linjie Li and Kevin Lin and Marc Niethammer and Lijuan Wang},
journal= {arXiv preprint arXiv:2411.02818},
year = {2024}
}
备注
Code&models: https://github.com/uncbiag/LiVOS