高效追踪任何东西
计算机视觉与模式识别
2024-12-02 v1
摘要
Segment Anything Model 2(SAM 2)已成为视频对象分割和追踪任何内容的强大工具。驱动 SAM 2 在视频对象分割性能方面表现突出的关键组件包括用于帧特征提取的大型多阶段图像编码器以及存储来自过去帧记忆上下文的记忆机制,以帮助当前帧的分割。多阶段图像编码器和记忆模块的高计算复杂度限制了其在现实世界任务中的应用,例如在移动设备上进行视频对象分割。为解决这一限制,我们提出了 EfficientTAMs,这些轻量级追踪任何模型能够以低延迟和小模型大小 produced high-quality results。我们的想法是重新审视基于纯非层次化 Vision Transformer(ViT)的图像编码器用于视频对象分割,并引入高效记忆模块,这一模块减少了帧特征提取和当前帧记忆计算的复杂度。我们采用纯粹的轻量级 ViTs 和高效记忆模块构建 EfficientTAMs,并在 SA-1B 和 SA-V 数据集上进行训练,用于视频对象分割和追踪任何任务。我们在多个视频分割基准测试上进行评估,包括半监督 VOS 和可提示视频分割,发现我们提出的 EfficientTAM 采用纯 ViT 在 A100 上相对于 SAM 2 模型(HieraB+SAM 2)性能相当,速度提升约为 2 倍,参数减少约 2.4 倍。在图像分割任务中,我们的 EfficientTAMs 相对于原始 SAM 也表现良好,A100 上速度提升约 20 倍,参数减少约 20 倍。在 iPhone 15 Pro Max 等移动设备上,我们的 EfficientTAMs 能够以约 10 FPS 的速度进行视频对象分割,保持合理的质量,凸显了小模型在设备端视频对象分割应用中的潜力。
引用
@article{arxiv.2411.18933,
title = {Efficient Track Anything},
author = {Yunyang Xiong and Chong Zhou and Xiaoyu Xiang and Lemeng Wu and Chenchen Zhu and Zechun Liu and Saksham Suri and Balakrishnan Varadarajan and Ramya Akula and Forrest Iandola and Raghuraman Krishnamoorthi and Bilge Soran and Vikas Chandra},
journal= {arXiv preprint arXiv:2411.18933},
year = {2024}
}