DINO-Tracker:驾驭 DINO 实现单视频自监督点跟踪
计算机视觉与模式识别
2024-07-12 v2
摘要
我们提出 DINO-Tracker——一种用于视频中长期密集跟踪的新框架。其核心支柱是将单视频上的测试时训练与预训练 DINO-ViT 模型学习到的强大局部语义特征相结合。具体而言,我们的框架同时采用 DINO 的特征以适应测试视频的运动观测,并训练一个直接利用这些精炼特征的跟踪器。整个框架通过自监督损失与正则化的组合进行端到端训练,该正则化使我们能够保留并受益于 DINO 的语义先验。广泛评估表明,我们的方法在已知基准上取得了最先进的结果。DINO-Tracker 显著优于自监督方法,并与最先进的监督跟踪器具有竞争力,同时在长期遮挡下的跟踪等挑战性场景中优于它们。
引用
@article{arxiv.2403.14548,
title = {DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single Video},
author = {Narek Tumanyan and Assaf Singer and Shai Bagon and Tali Dekel},
journal= {arXiv preprint arXiv:2403.14548},
year = {2024}
}
备注
Accepted to ECCV 2024. Project page: https://dino-tracker.github.io/