M2P:基于掩码到点的弱监督学习提升视觉基础模型以适应稠密点跟踪
计算机视觉与模式识别
2026-03-19 v1
摘要
跟踪任意点(TAP)已成为视频理解的基本工具。当前方法通过离线微调或测试时优化来适应类似DINOv2的视觉基础模型(VFMs)。然而,这些VFMs依赖静态图像预训练,这本质上不利于捕捉视频中稠密时序对应关系。为此,我们提出掩码到点(M2P)学习,利用丰富的视频对象分割(VOS)掩码标注改进VFMs以适应稠密点跟踪。M2P引入三项新的基于掩码的约束进行弱监督表示学习。首先,我们提出一种局部结构一致性损失,利用普氏分析建模位于局部结构内的点的协同运动,实现更可靠的点到点匹配学习。其次,我们提出一种掩码标签一致性(MLC)损失,强制所采样的前景点在各帧中严格匹配前景区域。所提MLC损失可视为一种正则化,稳定训练并防止收敛到平凡解。最后,应用掩码边界约束以显式监督边界点。我们展示,所提的弱监督M2P模型通过仅使用3.6K个VOS训练视频即可显著优于基线VFMs。值得注意的是,M2P在TAP-Vid-DAVIS基准上对DINOv2-B/14和DINOv3-B/16分别实现了12.8%和14.6%的性能提升。此外,所提M2P模型作为预训练主干网络用于测试时优化和离线微调TAP任务,表明其可作为点跟踪任务的通用预训练模型。代码将在接受录用后公开。
引用
@article{arxiv.2603.17813,
title = {M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking},
author = {Qiangqiang Wu and Tianyu Yang and Bo Fang and Jia Wan and Matias Di Martino and Guillermo Sapiro and Antoni B. Chan},
journal= {arXiv preprint arXiv:2603.17813},
year = {2026}
}