中文

视频中的开放世界目标计数

计算机视觉与模式识别 2025-12-15 v2 人工智能

摘要

我们提出了一个新的任务:视频中的开放世界目标计数。给定文本描述或图像示例指定目标对象,目标是对视频中所有唯一目标实例进行计数。这一任务在拥挤场景中尤其具有挑战性,由于遮挡和相似外观的对象,必须避免重复计数并识别重新出现的目标。为此,我们做出以下贡献:我们提出了一种模型 CountVid,用于该任务。它利用基于图像的计数模型和可提示的视频分割和跟踪模型,实现跨视频帧的自动化开放世界目标计数。为评估其性能,我们引入了 VideoCount 数据集,该数据集由 TAO 和 MOT20 跟踪数据集以及来自企鹅和金属合金结晶化的 x 射线视频构建而成。使用该数据集,我们证明 CountVid 提供了准确的目标计数,并且显著优于强大的基线方法。VideoCount 数据集、CountVid 模型以及所有代码已公开于 https://www.robots.ox.ac.uk/~vgg/research/countvid/。

关键词

引用

@article{arxiv.2506.15368,
  title  = {Open-World Object Counting in Videos},
  author = {Niki Amini-Naieni and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2506.15368},
  year   = {2025}
}

备注

AAAI 2026