中文

走路之外:面向文本驱动人物异常搜索的大规模图像-文本基准

计算机视觉与模式识别 2025-07-29 v3 多媒体

摘要

文本驱动人物搜索旨在使用自然语言描述在摄像头网络中检索特定个体。然而,当前的基准往往偏向常见动作如行走或站立,忽视了在现实场景中识别异常行为的关键需求。为此,我们提出了新的任务——文本驱动人物异常搜索,通过文本定位从事常规或异常活动的行人。为此,我们构建了一个大规模图像-文本行人异常行为(PAB)基准,涵盖广泛的动作范畴,如跑步、表演、踢球等,以及相应的异常情形,如倒地、遭受撞击等同一身份的个体。PAB 的训练集包含 1,013,605 组人造图像-文本对,既包含正常情况也包含异常情况;而测试集包括 1,978 组真实世界的图像-文本对。为验证 PAB 的潜力,我们引入了跨模态姿态感知框架,集成人体姿态模式与身份相关的硬负样本采样。在所提出的基准上进行的广泛实验表明,人造训练数据有助于实现精细的行为检索,而我们提出的姿态感知方法实现了 84.93% 的召回率@1 准确率,超越了其他竞争方法。数据集、模型和代码已公开于 https://github.com/Shuyu-XJTU/CMP。

关键词

引用

@article{arxiv.2411.17776,
  title  = {Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search},
  author = {Shuyu Yang and Yaxiong Wang and Li Zhu and Zhedong Zheng},
  journal= {arXiv preprint arXiv:2411.17776},
  year   = {2025}
}