中文

Track Anything:当 Segment Anything 遇见视频

计算机视觉与模式识别 2023-05-01 v2

摘要

近期,Segment Anything Model(SAM)因其在图像上令人印象深刻的分割性能而迅速获得大量关注。鉴于其在图像分割上的强大能力以及与不同提示的高交互性,我们发现它在视频的一致分割上表现不佳。因此,在本报告中,我们提出 Track Anything Model(TAM),其在视频中实现了高性能的交互式跟踪与分割。具体而言,给定一个视频序列,仅需极少的人为参与(即数次点击),人们便可跟踪任何感兴趣的目标,并在一次前向推理中获得满意结果。无需额外训练,这种交互式设计在视频目标跟踪与分割上表现优异。所有资源发布于 {https://github.com/gaomingqi/Track-Anything}。我们希望本工作能促进相关研究。

关键词

引用

@article{arxiv.2304.11968,
  title  = {Track Anything: Segment Anything Meets Videos},
  author = {Jinyu Yang and Mingqi Gao and Zhe Li and Shang Gao and Fangjing Wang and Feng Zheng},
  journal= {arXiv preprint arXiv:2304.11968},
  year   = {2023}
}

备注

Tech-report