视觉基础模型能否实现长期点跟踪?
计算机视觉与模式识别
2024-08-27 v1
摘要
大规模视觉基础模型已在各种任务中展现出显著成功,突显了其强大的泛化能力。虽然它们在两视图对应方面的能力已被探索,但在复杂环境中进行长期对应的有效性仍未得到研究。为此,我们在点跟踪的背景下评估了视觉基础模型的几何感知能力:(i) 在零样本设置下,无需任何训练;(ii) 通过使用低容量层进行探测;(iii) 通过使用低秩适应(LoRA)进行微调。我们的发现表明,Stable Diffusion和DINOv2的特征在零样本设置下展现出优越的几何对应能力。此外,DINOv2在适应设置下达到了与监督模型相当的性能,展示了其作为对应学习强初始化点的潜力。
引用
@article{arxiv.2408.13575,
title = {Can Visual Foundation Models Achieve Long-term Point Tracking?},
author = {Görkay Aydemir and Weidi Xie and Fatma Güney},
journal= {arXiv preprint arXiv:2408.13575},
year = {2024}
}
备注
ECCV 2024 - Emergent Visual Abilities and Limits of Foundation Models (EVAL-FoMo) Workshop