中文

难见难标:基于生成与符号的细微视觉现象获取

计算机视觉与模式识别 2026-04-29 v2 人工智能

摘要

细微视觉异常现象,如发条裂纹、亚毫米空洞和低对比度杂质,虽在结构上呈现异常,却在视觉上含糊不清,使得标注困难且在主动学习期间容易被忽视。基于判别不确定性或特征多样性的标准获取启发式方法常常过度选择主导模式,却在数据空间中对稀疏且重要区域的探索不足。这种失效模式在工业缺陷检测中尤为严重,因为异常现象可能既低流行度,又难以与周围结构区分。为解决此问题,我们提出了GSAL框架,这是一种用于目标检测的主动学习方法,融合了基于扩散的难度信号与层次化语义覆盖先验。扩散组件通过重建误差和去噪波动性对图像和候选框进行评分,优先选择视觉上异常或含糊的样本。然而,仅凭扩散无法防止在主导语义模式中反复偏好难样本。因此,语义组件将候选样本组织为三层概念图,并促进对 underrepresented 语义区域的覆盖,同时提供可解释的获取依据。通过在视觉难度与语义覆盖之间进行平衡,GSAL能够提高对细微且稀有目标的检索,这些目标通常被不确定性选择方法所忽略。在针对专有薄膜缺陷、Pascal VOC 和 MS COCO 数据集进行实验后,我们观察到该方法在标签效率和稀有类别检索方面 consistently 超过基于不确定性、多样性和混合方法的基线方法。

关键词

引用

@article{arxiv.2604.22990,
  title  = {Hard to See, Hard to Label: Generative and Symbolic Acquisition for Subtle Visual Phenomena},
  author = {Renjith Prasad and Rishabh Sharma and Andrew E. Shao and Annmary Justine Koomthanam and Shreyas Kulkarni and Suparna Bhattacharya and Martin Foltin and Amit Sheth and David Orozco and Matthew Quinn and Brian Sammuli},
  journal= {arXiv preprint arXiv:2604.22990},
  year   = {2026}
}

备注

Accepted at CVPR 2026 SVC Workshop