分割与跟踪任意目标
计算机视觉与模式识别
2023-05-12 v1
摘要
本报告提出一种称为 Segment And Track Anything(SAMTrack)的框架,允许用户精确高效地分割并跟踪视频中任意对象。此外,SAM-Track 采用多模态交互方法,使用户能根据特定需求选择视频中多个对象进行跟踪。这些交互方法包括点击、笔画与文本,各自具备独特优势且可组合使用。因此,SAM-Track 可应用于从无人机技术、自动驾驶、医学影像、增强现实到生物分析的广泛领域。SAM-Track 将交互式关键帧分割模型 Segment Anything Model(SAM)与我们提出的基于 AOT 的跟踪模型(DeAOT)——其在 VOT 2022 挑战赛四个赛道获第一名——相融合,以助力视频中对象跟踪。此外,SAM-Track 集成了 Grounding-DINO,使框架支持基于文本的交互。我们已在 DAVIS-2016 Val(92.0%)、DAVIS-2017 Test(79.2%)上展示了 SAM-Track 的卓越能力及其在多样应用中的实用性。项目页面位于:https://github.com/z-x-yang/Segment-and-Track-Anything。
引用
@article{arxiv.2305.06558,
title = {Segment and Track Anything},
author = {Yangming Cheng and Liulei Li and Yuanyou Xu and Xiaodi Li and Zongxin Yang and Wenguan Wang and Yi Yang},
journal= {arXiv preprint arXiv:2305.06558},
year = {2023}
}
备注
8 pages, 3 figures; Technical Report