视频目标计数的高效掩码自动编码器与大规模基准
计算机视觉与模式识别
2025-03-07 v2
摘要
前景-背景之间的动态不平衡是视频目标计数的主要挑战,通常由目标对象的稀疏性所致。这一问题在现有研究中鲜有探讨,常导致严重的低估或高估误差。为解决视频目标计数中的此问题,本文提出了一种基于密度嵌入的高效掩码自动编码器计数(E-MAC)框架。为提升模型在密度回归任务中的表征能力,我们发展了一种新的 ensity-mbedded asked mdeling()方法,首先将密度图作为辅助模态,对图像和密度图进行多模态自表征学习。虽然有助于有效的跨模态回归指导,但它也会引入冗余的背景信息,使模型难以聚焦于前景区域。为处理这一困境,我们提出了一种从密度图派生的高效空间自适应掩码,以提升效率。同时,我们采用基于光流的时序协作融合策略,有效捕获跨帧的动态变化,将特征对齐以导出多帧密度残差。通过利用相邻帧的信息,提升当前帧的计数精度。此外,鉴于大多数现有数据集局限于人类中心场景,本文首次提出了一个大规模视频鸟类计数数据集DroneBird,用于自然场景中的迁徙鸟类保护。对三个人群数据集和我们\textit{DroneBird}进行的广泛实验验证了我们的优势。代码和数据集均已公开。
关键词
引用
@article{arxiv.2411.13056,
title = {Efficient Masked AutoEncoder for Video Object Counting and A Large-Scale Benchmark},
author = {Bing Cao and Quanhao Lu and Jiekang Feng and Qilong Wang and Qinghua Hu and Pengfei Zhu},
journal= {arXiv preprint arXiv:2411.13056},
year = {2025}
}
备注
ICLR25