面向物理驱动异常检测的多轮物理信息视觉-语言模型
计算机视觉与模式识别
2026-03-17 v1
摘要
视觉-语言模型 (VLM) 在通用推理方面表现出强大能力,但在物理驱动的异常检测中仍受限,其中对动力学因果理解至关重要。现有的 VLM 主要基于外观关联性进行训练,无法捕捉运动约束,导致其在不规则旋转或违反力学运动等异常检测任务上表现不佳。我们引入一种物理信息指令调优框架,显式地将物体属性、运动范式和动态约束编码为结构化提示。通过多轮对话传递这些物理先验,我们的方法将因果推理分解为逐步推进的步骤,从而实现对正常与异常动力学的稳健内部表征。在 Phys-AD 数据集上进行评估,Our 方法在视频级检测中实现了 96.7% 的 AUROC -- 大幅超越先前 SOTA (66.9%) -- 并在因果解释方面获得更优的 0.777 的 LLM 分数。这一工作凸显了结构化物理先验如何将 VLM 转化为可靠的动态异常检测器。
引用
@article{arxiv.2603.15237,
title = {Multi-turn Physics-informed Vision-language Model for Physics-grounded Anomaly Detection},
author = {Yao Gu and Xiaohao Xu and Yingna Wu},
journal= {arXiv preprint arXiv:2603.15237},
year = {2026}
}
备注
Accepted by IEEE ICASSP2026