横跨姿态-语义鸿沟:基于级联框架的基于文本的人类异常搜索
计算机视觉与模式识别
2026-05-28 v2 多媒体
摘要
基于文本的人类异常搜索利用自然语言查询从监控档案中检索特定的行为事件。虽然最近的姿态感知方法在对齐几何结构方面表现良好,但面临一个根本性的姿态-语义鸿沟:语义上不同的动作可以共享相似的骨骼几何结构。虽然多模态大语言模型(MLLM)可以减轻这种模糊性,但其用于大规模检索计算成本太高。我们提出了 Structure-Semantic Decoupled Cascade(SSDC)框架,将检索分解为两个阶段:(1) 结构感知的粗略检索,在此阶段,轻量级模型通过骨骼相似性快速筛选候选对象;(2) 侦探小队互动,一种多智能体语义验证模块。该小队包括一个侦探进行快速二元筛选、一个分析师进行证据提取以及一个作家进行语义综合。最后我们通过融合综合后的标题与结构先验,对候选对象进行重新排序。实验在 PAB 数据集上表明,SSDC 在效率与语义推理之间取得了最先进的性能。
引用
@article{arxiv.2604.23282,
title = {Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search},
author = {Zequn Xie and Guijin Luo and Chuxin Wang and Sihang Cai and Tao Jin and Zhou Zhao and Yixuan Tang},
journal= {arXiv preprint arXiv:2604.23282},
year = {2026}
}
备注
Accepted to ACL 2026.10 pages, 5 figures