中文

面向综合道路状况评估的视觉语言基础模型

计算机视觉与模式识别 2026-04-10 v1

摘要

通用视觉语言模型在日常领域表现出强大能力,但在需要精确术语、结构化推理和遵循工程标准的专业技术领域却显得力不从众。本工作探索了特定于领域的指令调优是否可通过视觉语言模型实现全面道路状况评估。PaveInstruct包含278,889组覆盖32种任务类型的图像-指令-响应三元组,由统一来自九个异构道路数据集的标注构建而成。我们训练的PaveGPT模型在感知、理解与推理任务上对比评估了当前最先进的视觉语言模型。指令调优显著提升了模型能力,在空间定位、推理与生成任务中均取得超过20%的提升,同时产出符合ASTM D6433标准的输出。这些结果使交通部门能够部署统一的对话式评估工具,取代多个专业系统,简化工作流程并降低技术专家要求。该方法为跨基础设施领域(包括桥梁检验、铁路维护和建筑状况评估)发展以指令为导向的AI系统铺路。

关键词

引用

@article{arxiv.2604.08212,
  title  = {Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment},
  author = {Blessing Agyei Kyem and Joshua Kofi Asamoah and Anthony Dontoh and Armstrong Aboah},
  journal= {arXiv preprint arXiv:2604.08212},
  year   = {2026}
}