一种用于水下视频中难以辨识物体计数的密度引导时序注意力 Transformer
计算机视觉与模式识别
2024-03-07 v1
摘要
得益于视觉领域的最新发展,密集物体计数或人群计数已取得长足进步。然而,难以辨识物体计数(旨在统计与周围环境融为一体的目标数量)仍是一个挑战。基于图像的物体计数数据集一直是当前公开数据集的主流。因此,我们提出了一个名为 YoutubeFish-35 的大规模数据集,该数据集包含 35 个高清视频序列,具有高帧率,并在精选的多种场景中标注了超过 150,000 个中心点。为了基准测试,我们选择了三种主流的密集物体计数方法,并在新收集的数据集上对其进行了仔细评估。我们提出了 TransVidCount,这是一个新的强基线模型,它在统一框架中沿时序域结合了密度分支和回归分支,能够在 YoutubeFish-35 数据集上以最先进的性能有效解决难以辨识物体计数问题。
引用
@article{arxiv.2403.03461,
title = {A Density-Guided Temporal Attention Transformer for Indiscernible Object Counting in Underwater Video},
author = {Cheng-Yen Yang and Hsiang-Wei Huang and Zhongyu Jiang and Hao Wang and Farron Wallace and Jenq-Neng Hwang},
journal= {arXiv preprint arXiv:2403.03461},
year = {2024}
}
备注
Accepted by ICASSP 2024 (IEEE International Conference on Acoustics, Speech, and Signal Processing)