OD-VIRAT:面向真实监控环境的对象检测大规模基准
计算机视觉与模式识别
2025-07-21 v2
摘要
真实的人类监控数据集对于在真实世界条件下训练和评估计算机视觉模型至关重要,有助于开发针对复杂环境中人类及人类交互物体检测的鲁棒算法。这些数据集需要提供多样且具备挑战性的数据,以实现对模型性能的全面评估,并为公共安全创建更可靠的监控系统。为此,我们提出两种视觉对象检测基准,称为 OD-VIRAT Large 和 OD-VIRAT Tiny,旨在推动监控图像中的视觉理解任务。两种基准中的视频序列覆盖来自不同高度和距离的人类监控场景的 10 种不同场景。所提出的基准提供了丰富的边界框和类别注释,其中 OD-VIRAT Large 在 599,996 张图像中标注了 870 万个实例,OD-VIRAT Tiny 在 19,860 张图像中标注了 288,901 个实例。本 work 还聚焦于对这些最新发布的状态-of-the-art 对象检测架构进行基准测试,包括 RETMDET、YOLOX、RetinaNet、DETR 和 Deformable-DETR,这些架构针对该对象检测变种的 VIRAT 数据集进行测试。据我们所知,这是首次在面临复杂背景、遮挡物体和小尺寸物体等具有挑战性条件的情况下,对这些最近发布的状态-of-the-art 对象检测架构进行真实监控图像性能评估。所提出的基准测试和实验设置将有助于洞察所选对象检测模型的性能,并为开发更高效和更鲁棒的对象检测架构奠定基础。
引用
@article{arxiv.2507.12396,
title = {OD-VIRAT: A Large-Scale Benchmark for Object Detection in Realistic Surveillance Environments},
author = {Hayat Ullah and Abbas Khan and Arslan Munir and Hari Kalva},
journal= {arXiv preprint arXiv:2507.12396},
year = {2025}
}
备注
14 pages