中文

基础中的裂痕:挑战视觉基础模型的民用基础设施数据集

计算机视觉与模式识别 2026-05-20 v2

摘要

自动化结构健康监测对于防止灾难性的基础设施故障至关重要。需要精确的像素级缺陷分割来准确评估结构完整性,但由于需要昂贵的专家标注,数据的极度稀缺阻碍了民用基础设施缺陷分割的进展。该问题固有的算法障碍进一步加剧了对数据的需求,包括中心偏置以及在检查几乎无纹理的建筑材料时需要更多依赖形状。为了消除这一瓶颈,我们引入了 Cracks in the Foundation (CiF),这是迄今为止最大、最详细的民用基础设施(实例)分割数据集,包含约 150,000 张高分辨率图像,是与土木工程专家合作历时五年精心策划的。借助这一前所未有的数据源,我们揭示了当前视觉 AI 的一个盲点:尽管出现了可提示的基础模型 (FMs) 和视觉语言模型 (VLMs),尽管当今的专业分割模型具有令人印象深刻的能力,但结果表明,建筑环境中的密集图像理解远未得到解决。我们的评估表明,即使是最新的零样本 FM 在部署到现实世界基础设施时也面临重大挑战,甚至在具有特定领域监督的专业模型中,其性能也停滞在约 25% mAP。CiF 将民用基础设施检查这一基本且看似简单的感知任务确立为一项开放挑战,揭示了当前主要在互联网图像上训练的模型的基本弱点,从字面和比喻意义上都突显了当前基础模型范式中的裂痕。

关键词

引用

@article{arxiv.2605.18413,
  title  = {Cracks in the Foundation: A Civil Infrastructure Dataset to Challenge Vision Foundation Models},
  author = {Nicola Farronato and Niccolo Avogaro and Thomas Frick and Mattia Rigotti and Rizwan Ullah Khan and Michele Magno and Konrad Schindler and Cristiano Malossi and Florian Scheidegger},
  journal= {arXiv preprint arXiv:2605.18413},
  year   = {2026}
}