中文

IndoorCrowd:面向人体检测、分割与跟踪的多场景室内人群数据集

计算机视觉与模式识别 2026-04-03 v1 机器学习

摘要

理解拥挤室内环境中的人类行为是监控、智能建筑和人机交互的核心任务,但现有数据集往往难以在规模上捕捉真实世界的室内复杂性。我们介绍 IndoorCrowd,这是一个用于室内人体检测、实例分割和多目标跟踪的多场景数据集,数据采集自四个校园 locations(ACS-EC、ACS-EG、IE-Central、R-Central)。数据集包含 31 个视频(5 fps 下的 9,913 帧),配有经人工验证的逐实例分割掩码。我们构建了一个 620 帧的控制子集,用以对比三个基础模型自动标注器(SAM3、GroundingSAM 和 EfficientGroundingSAM)与人工标签之间的一致性(Cohen's κ)、平均精确率(AP)、精确率、召回率和掩码 IoU。进一步的 2,552 帧子集支持多目标跟踪任务,提供以 MOTChallenge 格式的连续身份轨迹。我们使用 YOLOv8n、YOLOv26n 和 RT-DETR-L 配合 ByteTrack、BoT-SORT 和 OC-SORT,建立了检测、分割和跟踪的基线模型。按场景分析显示,由于人群密度、尺度和遮挡的差异,难度存在显著变化:ACS-EC 场景中密集帧占比 79.3%,平均实例尺寸为 60.8 像素,是最具挑战性的场景。项目页面地址为 https://sheepseb.github.io/IndoorCrowd/。

关键词

引用

@article{arxiv.2604.02032,
  title  = {IndoorCrowd: A Multi-Scene Dataset for Human Detection, Segmentation, and Tracking with an Automated Annotation Pipeline},
  author = {Sebastian-Ion Nae and Radu Moldoveanu and Alexandra Stefania Ghita and Adina Magda Florea},
  journal= {arXiv preprint arXiv:2604.02032},
  year   = {2026}
}

备注

Accepted at Conference on Computer Vision and Pattern Recognition Workshops 2026