通过约束分解和指令微调实现可解释逻辑异常分类
计算机视觉与模式识别
2026-02-04 v1
摘要
逻辑异常是工业图像中对预定义约束(对象数量、空间布局和组成关系)违反的表现。虽然先前工作大多将异常检测视为二元决策,但此类表述无法指示哪条逻辑规则被破坏,因而为质量保证提供的价值有限。我们引入逻辑异常分类(LAC),将异常检测和细粒度违规分类统一于单个推理步骤中。为解决 LAC,我们提出 LogiCls,一个视觉语言框架,将复杂逻辑约束分解为可验证子查询序列。我们进一步提出数据中心指令合成管道,为这些子查询生成链式思维(CoT)监督,将精确 grounding 注释与多样化图像-文本增强相结合,以适应视觉语言模型(VLM)对逻辑敏感推理。通过难度感知抽样策略稳定训练,强调具有挑战性的子查询和长尾约束类型。广泛的实验表明,LogiCls 能为工业逻辑异常分类提供稳健、可解释且准确的解决方案,同时提供预测的违规类别及其证据轨迹。
引用
@article{arxiv.2602.03530,
title = {Interpretable Logical Anomaly Classification via Constraint Decomposition and Instruction Fine-Tuning},
author = {Xufei Zhang and Xinjiao Zhou and Ziling Deng and Dongdong Geng and Jianxiong Wang},
journal= {arXiv preprint arXiv:2602.03530},
year = {2026}
}
备注
6 pages, 6 figures