中文

快速稳健地处处追踪一切

计算机视觉与模式识别 2024-03-27 v1

摘要

我们提出了一种新颖的测试时优化方法,用于高效且稳健地跟踪视频中任意时刻的任意像素。最新的基于优化的跟踪技术 OmniMotion 需要长时间的优化,使其难以用于下游应用。OmniMotion 对随机种子选择敏感,导致收敛不稳定。为提高效率和鲁棒性,我们引入了一种新颖的可逆变形网络 CaDeX++,将函数表示分解为局部时空特征网格,并通过非线性函数增强耦合块的表达性。虽然 CaDeX++ 在其架构设计中包含更强的几何偏置,但它也利用了视觉基础模型提供的归纳偏置。我们的系统利用单目深度估计表示场景几何,并通过整合 DINOv2 长期语义来增强目标函数。我们的实验显示,在跟踪方面,相较于基于优化的 SoTA 方法 OmniMotion,本方法在训练速度(快于 **10 倍**)、鲁棒性和准确性方面都有显著提升。

关键词

引用

@article{arxiv.2403.17931,
  title  = {Track Everything Everywhere Fast and Robustly},
  author = {Yunzhou Song and Jiahui Lei and Ziyun Wang and Lingjie Liu and Kostas Daniilidis},
  journal= {arXiv preprint arXiv:2403.17931},
  year   = {2024}
}

备注

project page: https://timsong412.github.io/FastOmniTrack/