中文

利用运动信息提升自监督视频对应学习

计算机视觉与模式识别 2025-05-01 v2

摘要

自监督视频对应学习依赖于准确关联视频帧中对应同一视觉对象的像素的能力。然而,在没有监督的情况下实现可靠的像素匹配仍然是一个主要挑战。为了解决这个问题,最近的研究聚焦于旨在编码独特像素表示以进行匹配的特征学习技术。尽管取得了这些进展,现有方法仍然难以实现精确的像素对应,并且经常受到误匹配的影响,限制了它们在自监督设置中的有效性。为此,我们探索了一个高效的自监督视频对应学习框架(MER),旨在从未标记视频中准确提取对象细节。首先,我们设计了一个专用的运动增强引擎(Motion Enhancement Engine),强调捕捉视频中对象的动态运动。此外,我们引入了一种灵活的采样策略,用于像素间对应信息(多聚类采样器 Multi-Cluster Sampler),使模型能够更多地关注运动中重要对象的像素变化。通过实验,我们的算法在视频对应学习任务(如视频对象分割和视频对象关键点跟踪)上优于最先进的竞争对手。

关键词

引用

@article{arxiv.2503.12026,
  title  = {Leveraging Motion Information for Better Self-Supervised Video Correspondence Learning},
  author = {Zihan Zhou and Changrui Dai and Aibo Song and Xiaolin Fang},
  journal= {arXiv preprint arXiv:2503.12026},
  year   = {2025}
}