中文

AnomalyClaw:基于工具 grounding 反证的数据驱动通用视觉异常检测代理

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

视觉异常检测(VAD)在工业检查、医学成像、基础设施监控和遥感等众多实际领域中至关重要。然而,不同领域中异常定义、数据模态和标注标准的差异使得单一领域训练的VAD模型难以迁移。视觉语言模型(VV)预训练于大规模跨域数据,可通过任务指令执行视觉感知,为跨域VAD提供了有前景的解决方案。然而,单次推断的VLM判断不可靠,因为它们更依赖先验知识而非正常样本参考或细粒度特征证据。我们因此提出AnomalyClaw,一个训练-free VAD代理,将异常判断转化为多轮反证过程。在每一轮中,代理提出候选异常并针对正常样本参考进行驳斥,借助13个工具库进行视觉验证、参考解析和冻结专家探测。在CrossDomainVAD-12基准(12个数据集)上,AnomalyClaw在GPT-5.5上实现+6.23 pp宏观AUROC提升,在Seed2.0-lite上实现+7.93 pp,在Qwen3.5-VL-27B上实现+3.52 pp。我们进一步引入可选的语言化自演化扩展。它通过内部分支不一致构建线上规则手册,无需oracle标签。在Qwen3.5-VL-27B上,实现+2.09 pp的平均提升,相当于K=10的oracle标签监督基线(+1.99 pp)。这些结果表明,代理式反证改进了VLM的异常理解和推理,而不仅仅是聚合工具输出。

关键词

引用

@article{arxiv.2605.10397,
  title  = {AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation},
  author = {Xi Jiang and Yinjie Zhao and Zesheng Yang and Feng Zheng},
  journal= {arXiv preprint arXiv:2605.10397},
  year   = {2026}
}

备注

We release the agent, the benchmark, and the analysis artifacts at https://github.com/jam-cc/AnomalyClaw