EdgeTAM:设备端跟踪任意模型
计算机视觉与模式识别
2025-01-14 v1
摘要
在Segment Anything Model (SAM)的基础上,SAM 2通过记忆库机制进一步将其能力从图像扩展到视频输入,并取得了优于先前方法的显著性能,使其成为视频分割任务的基础模型。本文旨在使SAM 2更加高效,以便在移动设备上运行,同时保持可比的性能。尽管已有若干工作优化SAM以提高效率,但我们发现它们对于SAM 2并不足够,因为它们都专注于压缩图像编码器,而我们的基准测试表明,新引入的记忆注意力模块同样是延迟瓶颈。基于这一观察,我们提出EdgeTAM,利用新颖的2D空间感知器来降低计算成本。具体而言,所提出的2D空间感知器使用一个包含固定可学习查询的轻量级Transformer对密集存储的帧级记忆进行编码。鉴于视频分割是密集预测任务,我们发现保留记忆的空间结构至关重要,因此将查询分为全局级和块级两组。我们还提出了一种蒸馏流水线,在不增加推理开销的情况下进一步提升性能。最终,EdgeTAM在DAVIS 2017、MOSE、SA-V验证集和SA-V测试集上分别达到87.7、70.0、72.3和71.7的J&F,同时在iPhone 15 Pro Max上以16 FPS运行。
引用
@article{arxiv.2501.07256,
title = {EdgeTAM: On-Device Track Anything Model},
author = {Chong Zhou and Chenchen Zhu and Yunyang Xiong and Saksham Suri and Fanyi Xiao and Lemeng Wu and Raghuraman Krishnamoorthi and Bo Dai and Chen Change Loy and Vikas Chandra and Bilge Soran},
journal= {arXiv preprint arXiv:2501.07256},
year = {2025}
}
备注
Code will be released at https://github.com/facebookresearch/EdgeTAM