中文

AnomalyLMM:桥接生成式知识与判别式检索用于基于文本的人员异常搜索

计算机视觉与模式识别 2025-09-08 v2

摘要

随着公共安全需求的增长,基于文本的人员异常搜索已成为一项关键任务,旨在通过自然语言描述检索具有异常行为的个体。与传统的人员搜索不同,该任务面临两个独特挑战:(1) 文本异常与视觉行为之间的细粒度跨模态对齐,以及 (2) 稀疏真实世界样本下的异常识别。尽管大型多模态模型 (LMMs) 在多模态理解方面表现出色,但其在细粒度异常检索方面的潜力仍未得到充分探索,主要受限于:(1) 生成式知识与判别式检索之间的领域差距,以及 (2) 缺乏高效的部署适配策略。在这项工作中,我们提出了 AnomalyLMM,这是首个利用 LMMs 进行基于文本的人员异常搜索的框架。我们的主要贡献包括:(1) 一种新颖的由粗到精的流程,集成 LMMs 以桥接生成式世界知识与以检索为中心的异常检测;(2) 一种免训练的适配方案,包含掩码跨模态提示、行为显著性预测和知识感知重排序,能够零样本聚焦于细微的异常线索。作为探索 LMMs 用于此任务的首项研究,我们在 PAB 数据集上进行了严格评估,该数据集是唯一公开可用的基于文本的人员异常搜索基准,其精心整理的现实世界异常覆盖了多种场景(例如,跌倒、碰撞和被撞)。实验证明了所提方法的有效性,在 Recall@1 准确率上超越竞争基线 +0.96%。值得注意的是,我们的方法揭示了文本异常与视觉行为之间可解释的对齐关系,并通过定性分析得到验证。我们的代码和模型将发布以供未来研究。

关键词

引用

@article{arxiv.2509.04376,
  title  = {AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search},
  author = {Hao Ju and Hu Zhang and Zhedong Zheng},
  journal= {arXiv preprint arXiv:2509.04376},
  year   = {2025}
}