SynSpill:基于合成数据的工业溢渍检测改进方案
计算机视觉与模式识别
2026-04-23 v1 新兴技术
摘要
大规模视觉语言模型(VLM)通过强大的零样本能力已彻底变革了通用视觉识别。然而,在工业溢渍检测等特定、安全关键领域,其性能会显著下降,因为危险事件稀少、敏感且难以标注。这种稀缺性——源于隐私 concerns、数据敏感性以及真实事件不常见——使得大多数工业环境下常规目标检测器的微调难以实现。我们通过引入以可扩展框架为中心的高质量合成数据生成管道来解决这一挑战。我们展示,合成语料库有效地支持了视觉语言模型的参数高效微调(PEFT),并显著提升了YOLO和DETR等最新目标检测器的性能。值得注意的是,在没有SynSpill数据集的情况下,VLM仍能对未见的溢渍场景 generalization得更好。当使用SynSpill时,VLM和检测器均实现显著提升,两者的性能趋于相当。我们的结果凸显了高保真合成数据是桥接安全关键应用中领域差距的强大手段。合成生成与轻量级适应的组合为部署数据稀缺或不实用的工业环境中的视觉系统提供了成本效益高、可扩展的路径。项目页面:https://synspill.vercel.app
引用
@article{arxiv.2508.10171,
title = {SynSpill: Improved Industrial Spill Detection With Synthetic Data},
author = {Aaditya Baranwal and Abdul Mueez and Jason Voelker and Guneet Bhatia and Shruti Vyas},
journal= {arXiv preprint arXiv:2508.10171},
year = {2026}
}
备注
Accepted at ICCV (VISION'25 Workshop) 2025