中文

PASTA:视觉 Transformer 补丁聚合用于弱监督目标与异常分割

计算机视觉与模式识别 2026-04-14 v1 机器学习

摘要

检测非结构化环境中的未知异常是工业和农业应用(如材料回收和除草)的关键挑战。现有感知系统因依赖详尽标注数据集,常未能满足这些领域的严格运行要求, Specifically 包括实时处理、像素级分割精度和鲁棒准确率。为此,我们提出了名为 Patch Aggregation for Segmentation of Targets and Anomalies(PASTA)的弱监督管线,用于目标和异常的分割与分类。PASTA 通过分析自监督视觉 Transformer(ViT)特征空间中的分布差异,识别目标和异常对象。我们的管线利用语义文本提示通过 Segment Anything Model 3 指导零样对象分割。评估在定制的钢铁屑回收数据集和植物数据集上进行,显示我们的方案较领域特定基线训练时间缩短 75.8%。尽管具有域无关性,我们的方法在工业和农业领域实现了优异的目标(最高达 88.3% IoU)和异常(最高达 63.5% IoU)分割性能。

关键词

引用

@article{arxiv.2604.09701,
  title  = {PASTA: Vision Transformer Patch Aggregation for Weakly Supervised Target and Anomaly Segmentation},
  author = {Melanie Neubauer and Elmar Rueckert and Christian Rauch},
  journal= {arXiv preprint arXiv:2604.09701},
  year   = {2026}
}