中文

Match4Annotate:基于隐式神经特征匹配的稀疏视频标注传递

计算机视觉与模式识别 2026-03-18 v2

摘要

获取每帧视频的标注仍是计算机视觉在医学影像等专业领域部署的主要瓶颈,因为专家标注缓慢且成本高昂。标签传递提供了自然的解决方案,但现有方法面临根本性限制。视频跟踪器和分割模型可以在单个序列内传递标签,但需要针对每个视频进行初始化,无法跨视频推广。经典的配准管道基于检测器挑选的关键点,难以在低纹理场景中工作,而稠密特征匹配和单次分割方法则实现了跨视频传递,但缺乏时空平滑性和对点和掩码标注的统一支持。我们提出Match4Annotate,一个用于点和掩码标注的内视频和跨视频传递的轻量级框架。该方法在测试时为DINOv3特征拟合一个基于SIREN的隐式神经表示,生成连续的、高分辨率的时空特征场,并学习帧对之间的平滑隐式变形场以指导配准匹配。我们在三个具有挑战性的临床超声数据集上进行评估。Match4Annotate实现了最先进的跨视频传递,优于特征匹配和单次分割基线,同时对内视频传递保持与专用跟踪器的竞争力。我们的结果表明,轻量级、测试时优化的特征匹配管道有望为可扩展的标注工作流程提供高效且可接近的解决方案。

关键词

引用

@article{arxiv.2603.06471,
  title  = {Match4Annotate: Propagating Sparse Video Annotations via Implicit Neural Feature Matching},
  author = {Zhuorui Zhang and Roger Pallarès-López and Praneeth Namburi and Brian W. Anthony},
  journal= {arXiv preprint arXiv:2603.06471},
  year   = {2026}
}