中文

视频目标计数的高效掩码自动编码器与大规模基准

计算机视觉与模式识别 2025-03-07 v2

摘要

前景-背景之间的动态不平衡是视频目标计数的主要挑战,通常由目标对象的稀疏性所致。这一问题在现有研究中鲜有探讨,常导致严重的低估或高估误差。为解决视频目标计数中的此问题,本文提出了一种基于密度嵌入的高效掩码自动编码器计数(E-MAC)框架。为提升模型在密度回归任务中的表征能力,我们发展了一种新的 D\mathtt{D}ensity-E\mathtt{E}mbedded M \mathtt{M}asked mO\mathtt{O}deling(DEMO\mathtt{DEMO})方法,首先将密度图作为辅助模态,对图像和密度图进行多模态自表征学习。虽然DEMO\mathtt{DEMO}有助于有效的跨模态回归指导,但它也会引入冗余的背景信息,使模型难以聚焦于前景区域。为处理这一困境,我们提出了一种从密度图派生的高效空间自适应掩码,以提升效率。同时,我们采用基于光流的时序协作融合策略,有效捕获跨帧的动态变化,将特征对齐以导出多帧密度残差。通过利用相邻帧的信息,提升当前帧的计数精度。此外,鉴于大多数现有数据集局限于人类中心场景,本文首次提出了一个大规模视频鸟类计数数据集DroneBird,用于自然场景中的迁徙鸟类保护。对三个人群数据集和我们\textit{DroneBird}进行的广泛实验验证了我们的优势。代码和数据集均已公开。

关键词

引用

@article{arxiv.2411.13056,
  title  = {Efficient Masked AutoEncoder for Video Object Counting and A Large-Scale Benchmark},
  author = {Bing Cao and Quanhao Lu and Jiekang Feng and Qilong Wang and Qinghua Hu and Pengfei Zhu},
  journal= {arXiv preprint arXiv:2411.13056},
  year   = {2025}
}

备注

ICLR25